項目簡介
FlashInfer 是一個開源的 CUDA 庫,專門用於加速大語言模型(LLM)在 NVIDIA GPU 上的推理過程。項目涵蓋了注意力、GEMM 和 MoE 等多種核心內核,旨在提升推理性能。
核心功能
- 提供針對 LLM 推理優化的注意力內核。
- 包含高效的 GEMM(通用矩陣乘法)內核。
- 支持混合專家(MoE)模型的內核實現。
技術棧
項目主要使用 Python 編寫,底層基於 CUDA 技術,適用於 NVIDIA GPU 架構,支持從 Turing 到 Blackwell 的多種硬體。
許可證
FlashInfer 採用 Apache-2.0 許可證,允許用戶自由使用、修改和分發。
開源狀態
作為開源項目,FlashInfer 在 GitHub 上公開,目前擁有 5876 顆星標,社區活躍。










評論
暫無評論
成為第一個評論的人