组件
每个组件都与参考实现进行对照验证,并在不同输入规模下进行基准测试。选一个,复制它,证据一并带走。
AI
LLM 相关的数据处理:分块、规范化、去重、token 计数。
示例数据
File Hash
基于 BLAKE3 和 SHA-256 的流式哈希,用于文件完整性校验和数据集中的完全重复检测。
- 对照验证
- hashlib
- 最高
- 快 5.7×
MinHash
基于 MinHash 签名的近似重复检测,结果与 datasketch 逐位一致。以常数空间估算 token 集合之间的 Jaccard 相似度,用于 RAG 语料库和训练数据的去重。
- 对照验证
- datasketch
- 最高
- 快 19×
示例数据
Text Chunker
面向 RAG 的递归文本切分。按段落、句子和单词边界将文档切分为指定大小并带重叠的分块。
- 对照验证
- langchain-text-splitters
- 最高
- 快 26×
示例数据
Token Counter
按 OpenAI 兼容编码(cl100k_base、o200k_base)统计 BPE token 数量,无需构建 token 列表。
- 对照验证
- tiktoken
- 最高
- 快 1.7×
示例数据
Unicode Normalize
面向文本流水线的 Unicode 清理:NFC/NFKC 规范化、空白折叠以及不可见字符移除。
- 对照验证
- unicodedata
- 最高
- 快 2.2×
安全
日志解析、模式匹配、哈希计算、二进制分析。
示例数据
Byte Entropy
在二进制文件的滑动窗口上计算香农熵,用于发现加壳或加密的区段。
- 对照验证
- scipy.stats.entropy
- 最高
- 快 35×
示例数据
File Hash
基于 BLAKE3 和 SHA-256 的流式哈希,用于文件完整性校验和数据集中的完全重复检测。
- 对照验证
- hashlib
- 最高
- 快 5.7×
示例数据
Log Parse
将 syslog(RFC 3164 / 5424)和常见 Web 服务器访问日志解析为结构化记录。
- 对照验证
- re
- 最高
- 快 20×
示例数据
Multi-pattern Match
使用 Aho–Corasick 一次扫描匹配数千个模式,用于在日志和载荷中查找入侵指标(IOC)。
- 对照验证
- pyahocorasick
- 最高
- 快 5.0×