Gigatoken,一个面向LLM训练数据处理的高速分词器(tokenizer)。地址:github.com/marcelroed/gigatoken/
项目自测它在部分场景下可比 HuggingFace Tokenizers 快约 1000 倍。
大语言模型在训练前,需要把文本切成 token,这一步叫 tokenization。常见工具包括 HuggingFace Tokenizers 和 OpenAI 生态里的 tiktoken。处理 OpenWebText、Common Crawl 这类海量语料时,分词会变成工程瓶颈。Gigatoken 关注的正是这个环节:用 Rust、SIMD、缓存优化和减少 Python 开销,把分词吞吐量推到 GB/s 级别。
