項目簡介
TensorRT-LLM 是 NVIDIA 推出的開源庫,專注於在 NVIDIA GPU 上優化大語言模型和視覺生成模型的推理性能。
核心功能
- 提供 PyTorch 原生的 Python API,基於 C++ 運行時。
- 包含自定義 CUDA 內核,用於注意力機制、GEMM 和混合專家(MoE)。
- 運行時支持預填充解碼分離、推測解碼和廣泛專家並行。
- 支持通過多種並行策略進行多 GPU 和多節點部署。
技術棧
主要程式語言為 Python,底層為 C++ 運行時和 CUDA 內核,併集成 Triton 推理伺服器。
許可證
許可證類型為 Other。
獲取與上手
倉庫中提供了預構建模型配方,例如 DeepSeek-V3,用戶可參考這些配方開始使用。










評論
暫無評論
成為第一個評論的人