Por qué DataStore es más rápido
1. SQL Pushdown
2. Poda de columnas
3. Evaluación diferida
Benchmark: DataStore vs pandas
Entorno de prueba
- Datos: 10 millones de filas
- Hardware: portátil estándar
- Formato de archivo: CSV
Resultados
Puntos clave
- Operaciones de GroupBy: DataStore es hasta 19.93x más rápido
- Canalizaciones complejas: DataStore es 5-6x más rápido (gracias al pushdown en SQL)
- Operaciones de slicing simples: rendimiento comparable; diferencia insignificante
- Caso de uso ideal: operaciones de varios pasos con groupby/agregación
- Zero-copy:
to_df()no tiene sobrecarga por conversión de datos
Cuándo conviene usar DataStore
Agregaciones exigentes
Canalizaciones complejas
Procesamiento de archivos de gran tamaño
Operaciones con varias columnas
Cuándo pandas ofrece un rendimiento comparable
Conjuntos de datos pequeños (<1,000 filas)
Operaciones simples de slicing
Funciones lambda personalizadas de Python
ImportanteIncluso en los casos en que DataStore es “más lento”, el rendimiento suele estar a la altura de pandas; la diferencia es insignificante en la práctica. Las ventajas de DataStore en operaciones complejas superan con creces estos casos puntuales.Para un control más preciso de la ejecución, consulte Configuración de Execution Engine.
Integración zero-copy de DataFrames
to_df()es prácticamente gratuito: no hay serialización ni copias de memoria- Crear un DataStore a partir de un DataFrame de pandas es instantáneo
- La memoria se comparte entre DataStore y las vistas de pandas
Consejos de optimización
1. Activa el modo de rendimiento para cargas de trabajo intensivas
dtype), activa el modo de rendimiento para maximizar el throughput: