Características principales
- Motor SQL OLAP en el mismo proceso - Con tecnología de ClickHouse, no es necesario instalar ClickHouse server
- Múltiples formatos de datos - Compatibilidad de entrada y salida con Parquet, CSV, JSON, Arrow, ORC y más de 70 formatos
- Copia de datos minimizada - De C++ a Python con python memoryview
- Amplia integración con el ecosistema de Python - Soporte nativo para Pandas, Arrow y DB API 2.0; se integra sin problemas en los flujos de trabajo de ciencia de datos existentes
- Cero dependencias - No requiere instalaciones externas de bases de datos
- DataStore API - API compatible con pandas con optimización SQL, compatible con más de 630 métodos
DataStore: API compatible con pandas
Migración en una sola línea
Aspectos destacados del rendimiento
Benchmarks con 10M de filas
Características de DataStore
- Más de 630 métodos de API - 209 métodos de pandas DataFrame y más de 185 métodos de accessor
- Evaluación diferida - Las operaciones se compilan en SQL optimizado
- SQL pushdown - Los filtros y las agregaciones se ejecutan en la fuente de datos
- Fuentes de datos universales - Permite leer desde archivos, S3, bases de datos y lagos de datos
¿Qué lenguajes admite chDB?
¿Cómo empiezo?
- Si usas Go, Rust, NodeJS, Bun o C y C++, consulta la página correspondiente de cada lenguaje.
- Si usas Python, consulta la guía de inicio para desarrolladores o el curso bajo demanda de chDB.
Para usuarios de pandas
- Inicio rápido de DataStore - Instalación y migración en una sola línea
- Migración desde pandas - Guía de migración paso a paso
- Recetario de pandas - Patrones comunes
- Diferencias clave - Diferencias importantes con respecto a pandas
- Guía de rendimiento - Consejos de optimización
Referencia de la API de DataStore
- Métodos de fábrica - Crear a partir de archivos, bases de datos y almacenamiento en la nube
- Construcción de consultas - Operaciones tipo SQL
- Compatibilidad con pandas - 209 métodos compatibles
- Accesores - .str, .dt, .arr, .json, .url, .ip, .geo
- Configuración - motor, logging y profiling
- Depuración - explain(), profiling y logging
Guías de la API SQL
- Referencia de la API de Python - Documentación completa de la API SQL
- JupySQL
- Consultas con Pandas
- Consultas con Apache Arrow
- Consulta de datos en S3
- Consulta de archivos Parquet
- Consultas en ClickHouse remoto
- Uso de la base de datos clickhouse-local
Un video introductorio
Benchmarks de rendimiento
- ClickBench of embedded engines - Comparación de rendimiento de la API de SQL
- DataFrame Benchmark - Comparación de motores DataFrame
- DataStore vs Pandas - Hasta 20 veces más rápido que pandas en operaciones habituales
Acerca de chDB
- Lee la historia completa del nacimiento del proyecto chDB en el blog
- Lee sobre chDB y sus casos de uso en el Blog
- Haz el curso on-demand de chDB
- Descubre chDB en tu navegador con ejemplos de codapi
- Consulta más ejemplos en (https://github.com/chdb-io/chdb/tree/main/examples)