項目簡介
Curator是NVIDIA NeMo團隊推出的開源數據預處理工具包,專門用於大語言模型(LLM)訓練的數據準備。它旨在幫助開發者從海量原始語料中提取高質量數據,提升訓練效果。
核心功能
- 文本清洗:去除噪聲和無關內容。
- 質量過濾:基於規則或模型篩選低質量樣本。
- 去重:消除重複數據,減少冗餘。
技術棧
項目主語言為Python,但核心組件使用Rust重寫,以提供出色的性能。這種混合設計讓Curator既能保持Python的易用性,又能獲得Rust的高效處理能力。
許可證
Curator採用Apache-2.0許可證,允許自由使用和修改。
如何上手
根據README摘要,Curator設計為模塊化流水線,可無縫集成到現有數據處理流程中。具體安裝和使用方法請參考項目官方文檔。










評論
暫無評論
成為第一個評論的人