Skip to main content

소개

LAION 5b 데이터셋에는 58억 5천만 개의 이미지-텍스트 임베딩과 관련 이미지 메타데이터가 포함되어 있습니다. 임베딩은 Open AI CLIP 모델 ViT-L/14를 사용해 생성되었습니다. 각 임베딩 벡터의 차원은 768입니다. 이 데이터셋은 대규모 실제 벡터 검색 애플리케이션의 설계, 규모 산정, 성능 측면을 모델링하는 데 사용할 수 있습니다. 이 데이터셋은 텍스트-이미지 검색과 이미지-이미지 검색 모두에 사용할 수 있습니다.

데이터셋 세부 정보

전체 데이터셋은 opendatalab/laion5b-downloader를 사용하여 다운로드할 수 있습니다. ClickHouse는 공개 S3 버킷에 1천만 개 벡터의 부분 집합을 제공했습니다. 부분 집합은 하나의 Parquet 파일에 저장됩니다. 이 데이터셋에 필요한 스토리지와 메모리 요구 사항을 추정하려면 먼저 문서를 참고하여 규모 산정을 수행하는 것이 좋습니다.

단계

1

테이블 생성

laion_5b_10m 테이블을 생성하여 embeddings 및 관련 속성을 저장합니다:
id는 단순히 증가하는 정수입니다. 추가 속성은 문서에서 설명한 포스트필터링/프리필터링과 결합된 벡터 유사도 검색을 이해하기 위한 프레디케이트에 사용할 수 있습니다.
2

데이터 로드

데이터셋을 로드하려면 다음 SQL 문을 실행하세요:
1,000만 행을 테이블에 로드하는 데 몇 분 정도 걸립니다.
4

벡터 유사성 인덱스 구축

다음 SQL을 실행하여 laion_5b_10m 테이블의 vector 컬럼에 벡터 유사성 인덱스를 정의하고 생성합니다:
인덱스 생성 및 검색의 매개변수와 성능 고려 사항은 문서에 설명되어 있습니다. 위 문에서는 HNSW 하이퍼매개변수 Mef_construction에 각각 64와 512를 사용합니다. 인덱스 빌드 시간과 선택한 값에 따른 검색 결과 품질을 평가하여 이러한 매개변수의 최적값을 신중하게 선택해야 합니다.사용 가능한 CPU 코어 수와 스토리지 대역폭에 따라 1,000만 행 부분 집합에 대한 인덱스를 빌드하고 저장하는 데 상당한 시간이 걸릴 수 있습니다.
6

검색 쿼리용 임베딩 생성

LAION 5b 데이터셋의 임베딩 벡터는 OpenAI CLIP 모델 ViT-L/14를 사용해 생성되었습니다.아래 Python 스크립트 예시는 CLIP API를 사용해 프로그래밍 방식으로 임베딩 벡터를 생성하는 방법을 보여줍니다. 그런 다음 검색 임베딩 벡터를 SELECT 쿼리에서 cosineDistance() 함수의 인수로 전달합니다.clip 패키지 설치 방법은 OpenAI GitHub 리포지토리를 참고하십시오.
위 검색 결과는 다음과 같습니다.
마지막 수정일 2026년 8월 26일