[R-Forge #1705] Change CJ internally not to expand, for efficiency
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Refactorización
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- r
- Área
- data, performance
Línea de trabajo
Start by tracing CJ(), binarysearch, and [.data.table to understand how CJ columns are currently allocated and indexed. Review the linked R-Forge discussion and use datatable-help for the under-the-hood behavior; done means establishing and implementing a viable allocation-saving design without changing normal user-visible behavior.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Submitted by: Matt Dowle; Assigned to: Nobody; R-Forge link
CJ() could return an irregular column length data.table (its inputs unchanged), marked somehow so that binarysearch knows to %% index through the CJ columns, rather than allocating long vectors and populating them as CJ currently does. Purely for speed, with no changes for users unless perhaps CJ() has been used outside [.data.table.
Or, more generally, data.table columns could be marked so that indexing to them knows they should be recycled, without actually allocating and recycling the columns. Discuss on datatable-help needed as under-the-hood code e.g. DT$foo[903] might not work if it was internally a short vector. In reality it's probably only useful for CJ() as regular data.table's only have recycled data perhaps to start with creating them with say an NA column but then are quickly populated. If a large table has a column with the same value (say NA or 0) for every row, perhaps the column is redundant. Can't imagine that recycling >1 items is often useful (other than in CJ()).
- Lenguaje dominante
- R
- Estrellas
- 3.9k
- Forks
- 1.1k
- Merge medio
- 14 h 4 min
- PR fusionados (30 d)
- 4
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de Rdatatable/data.table
-
as.data.table() recurses without end on a survival::Surv object (or any data.frame carrying one) Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Rdatatable/data.table#7887 ·
-
consistency tests
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
Rdatatable/data.table#7853 · 3 comentarios ·
-
internals
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
Rdatatable/data.table#6938 · 1 comentario ·
-
encoding fread
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
Rdatatable/data.table#5179 · 8 comentarios ·
-
documentation programming
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
Rdatatable/data.table#3199 · 3 comentarios ·
Todos los issues de Rdatatable/data.table
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
r-lib/pkgdepends#485 · 3 comentarios ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 92/100
-
beginners blocker
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
enviPathR AbiertoBuild Error Build OK Build Warning policies-accepted pre-review precheck-passed
Dificultad 1/5 Menos de una hora Aptitud para principiantes 84/100
Bioconductor/BiocContributions#207 · 6 comentarios ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
datacarpentry/semester-biology#1255 ·