- 모든 컬럼과 모든 컬럼 튜플에 대한 값의 카디널리티(cardinality, 고유값 수)
- 조건부 카디널리티: 다른 컬럼 값의 조건에 따른 특정 컬럼의 고유값 수
- 정수 절댓값의 확률 분포, signed integer의 부호, float의 지수부와 부호
- 문자열 길이의 확률 분포
-
숫자 0, 빈 문자열과 배열,
NULL의 출현 확률 - LZ77 및 entropy 계열 코덱으로 압축했을 때의 데이터 압축률
- table 전반에서 시간값의 연속성(값 차이의 크기), floating-point 값의 연속성
-
DateTime값의 날짜 component - 문자열 값의 UTF-8 유효성
- 문자열 값이 자연스럽게 보이도록 함
IsMobile 컬럼이 있으면, 변환된 데이터에서도 동일한 값을 가집니다.
따라서 모바일 트래픽의 정확한 비율을 계산할 수 있습니다.
다른 예를 들어보겠습니다. table에 사용자 이메일과 같은 비공개 데이터가 있고, 어떤 이메일 주소도 공개하고 싶지 않다고 가정하겠습니다.
table이 충분히 크고 서로 다른 이메일이 여러 개 있으며 특정 이메일의 빈도가 다른 값보다 훨씬 높지 않다면 모든 데이터가 익명화됩니다. 하지만 컬럼에 서로 다른 값의 수가 적으면 그중 일부가 그대로 재현될 수 있습니다.
이 도구의 동작 알고리즘을 살펴보고 명령줄 매개변수를 세밀하게 조정해야 합니다.
이 도구는 최소한 어느 정도 규모의 데이터(적어도 수천 개의 행)가 있을 때만 제대로 동작합니다.