부품
모든 부품은 참조 구현과 대조해 검증하고, 다양한 입력 크기에서 벤치마크합니다. 하나를 골라 복사하고, 증거는 곁에 두세요.
AI
LLM 주변의 데이터 처리: 청킹, 정규화, 중복 제거, 토큰 계산.
샘플 데이터
File Hash
BLAKE3와 SHA-256 스트리밍 해시. 파일 무결성 검사와 데이터셋의 완전 중복 탐지에 씁니다.
- 검증 기준
- hashlib
- 최대
- 5.7× 빠름
MinHash
MinHash 시그니처를 이용한 유사 중복 탐지. datasketch와 비트 단위로 같은 결과를 냅니다. 토큰 집합 간의 Jaccard 유사도를 일정한 메모리로 추정하여 RAG 코퍼스와 학습 데이터의 중복을 제거합니다.
- 검증 기준
- datasketch
- 최대
- 19× 빠름
샘플 데이터
Text Chunker
RAG를 위한 재귀적 텍스트 분할. 문단·문장·단어 경계에서 문서를 나눠 지정한 크기와 겹침을 가진 청크로 만듭니다.
- 검증 기준
- langchain-text-splitters
- 최대
- 26× 빠름
샘플 데이터
Token Counter
OpenAI 호환 인코딩(cl100k_base, o200k_base)의 BPE 토큰 수를 셉니다. 토큰 목록은 만들지 않습니다.
- 검증 기준
- tiktoken
- 최대
- 1.7× 빠름
샘플 데이터
Unicode Normalize
텍스트 파이프라인을 위한 Unicode 정리: NFC/NFKC 정규화, 공백 정리, 보이지 않는 문자 제거.
- 검증 기준
- unicodedata
- 최대
- 2.2× 빠름
보안
로그 파싱, 패턴 매칭, 해싱, 바이너리 분석.
샘플 데이터
Byte Entropy
바이너리의 슬라이딩 윈도우마다 섀넌 엔트로피를 계산해 패킹되거나 암호화된 구간을 찾습니다.
- 검증 기준
- scipy.stats.entropy
- 최대
- 35× 빠름
샘플 데이터
File Hash
BLAKE3와 SHA-256 스트리밍 해시. 파일 무결성 검사와 데이터셋의 완전 중복 탐지에 씁니다.
- 검증 기준
- hashlib
- 최대
- 5.7× 빠름
샘플 데이터
Log Parse
syslog(RFC 3164 / 5424)와 일반적인 웹 서버 접근 로그를 구조화된 레코드로 파싱합니다.
- 검증 기준
- re
- 최대
- 20× 빠름
샘플 데이터
Multi-pattern Match
Aho–Corasick으로 수천 개의 패턴을 한 번의 스캔으로 매칭합니다. 로그와 페이로드에서 침해 지표(IOC)를 찾는 데 씁니다.
- 검증 기준
- pyahocorasick
- 최대
- 5.0× 빠름