Características principales
- Compatibilidad con Pandas: 209 métodos de pandas DataFrame, 56 métodos
.str, 42+ métodos.dt - Optimización SQL: Las operaciones se compilan automáticamente como consultas SQL optimizadas
- Evaluación diferida: Las operaciones se aplazan hasta que se necesitan los resultados
- 630+ métodos de API: Amplia API para la manipulación de datos
- Extensiones de ClickHouse: Accesores adicionales (
.arr,.json,.url,.ip,.geo) no disponibles en pandas
Arquitectura
- Cadena de operaciones diferidas: las operaciones se registran, no se ejecutan de inmediato
- Selección inteligente de motor: QueryPlanner dirige cada segmento al motor óptimo (chDB para SQL, Pandas para operaciones complejas)
- Caché intermedia: los resultados se almacenan en caché en cada paso para agilizar la exploración iterativa
Migración en una sola línea desde Pandas
Comparación de rendimiento
Benchmark con 10 M de filas. Consulta el script de benchmark y la Guía de rendimiento para obtener más detalles.
Cuándo usar DataStore
- Trabajas con conjuntos de datos grandes (millones de filas)
- Realizas agregaciones y operaciones de GroupBy
- Consultas datos de archivos, bases de datos o almacenamiento en la nube
- Creas canalizaciones de datos complejas
- Quieres la API de pandas con mejor rendimiento
- Prefieres escribir SQL directamente
- Necesitas un control preciso sobre la ejecución de consultas
- Trabajas con funciones específicas de ClickHouse que no están expuestas en la API de pandas
Comparación de características
Estadísticas de la API
Primeros pasos
- Inicio rápido - Instalación y uso básico
- Migración desde Pandas - Guía de migración paso a paso
Referencia de la API
- Métodos de fábrica - Creación de DataStore a partir de varias fuentes
- Construcción de consultas - Operaciones de consulta al estilo SQL
- Compatibilidad con pandas - Los 209 métodos compatibles con pandas
- Accesores - Accesores de String, DateTime, Array, JSON, URL, IP y Geo
- Agregación - Funciones de agregación y de ventana
- Operaciones de E/S - Lectura y escritura de datos
Temas avanzados
- Modelo de ejecución - evaluación diferida y almacenamiento en caché
- Referencia de class - Referencia completa de la API
Configuración y depuración
- Configuración - Todas las opciones de configuración
- Modo de rendimiento - Modo centrado en SQL para obtener el máximo rendimiento
- Depuración - Explain, perfilado y registro
Guías para usuarios de Pandas
- Recetario de Pandas - Patrones comunes
- Diferencias clave - Diferencias importantes con respecto a pandas
- Guía de rendimiento - Consejos de optimización
- SQL para usuarios de Pandas - Comprender el SQL que hay detrás de las operaciones de pandas
Ejemplo rápido
Próximos pasos
- ¿Es la primera vez que usas DataStore? Empieza con la Guía de inicio rápido
- ¿Vienes de pandas? Lee la Guía de migración
- ¿Quieres saber más? Consulta la Referencia de la API