Motores disponibles
Configurar el motor
Configuración global
Comprobar el motor actual
Auto Mode
auto (por defecto), DataStore selecciona el motor óptimo para cada operación:
Operaciones ejecutadas en chDB
- Filtrado compatible con SQL (
filter(),where()) - Selección de columnas (
select()) - Ordenación (
sort(),orderby()) - Agrupación y agregación (
groupby().agg()) - Uniones (
join(),merge()) - Eliminación de duplicados (
distinct(),drop_duplicates()) - Limitación de resultados (
limit(),head(),tail())
Operaciones ejecutadas en pandas
- Funciones
applypersonalizadas (apply(custom_func)) - Tablas dinámicas complejas con agregaciones personalizadas
- Operaciones que no se pueden expresar en SQL
- Cuando la entrada ya es un pandas DataFrame
Ejemplo
Modo chDB
Cuándo usar
- Procesamiento de grandes conjuntos de datos (millones de filas)
- Cargas de trabajo con agregaciones intensivas
- Cuando se busca la máxima optimización de SQL
- Comportamiento coherente en todas las operaciones
Características de rendimiento
Limitaciones
- Es posible que no se admitan funciones personalizadas en Python
- Algunas funciones específicas de pandas requieren conversión
Modo pandas
Cuándo usar
- Pruebas de compatibilidad con pandas
- Uso de funciones específicas de pandas
- Depuración de problemas relacionados con pandas
- Cuando los datos ya están en formato pandas
Características de rendimiento
Motor entre DataStores
Ejemplo
Lógica de selección del motor
Árbol de decisión de Auto Mode
Sobrescritura a nivel de función
Comparación de rendimiento
Conclusiones clave:
- chDB destaca en las agregaciones y los pipelines complejos
- pandas es ligeramente más rápido en operaciones simples aisladas
- Usa el modo
autopara aprovechar lo mejor de ambos