项目简介
FlashInfer 是一个开源的 CUDA 库,专门用于加速大语言模型(LLM)在 NVIDIA GPU 上的推理过程。项目涵盖了注意力、GEMM 和 MoE 等多种核心内核,旨在提升推理性能。
核心功能
- 提供针对 LLM 推理优化的注意力内核。
- 包含高效的 GEMM(通用矩阵乘法)内核。
- 支持混合专家(MoE)模型的内核实现。
技术栈
项目主要使用 Python 编写,底层基于 CUDA 技术,适用于 NVIDIA GPU 架构,支持从 Turing 到 Blackwell 的多种硬件。
许可证
FlashInfer 采用 Apache-2.0 许可证,允许用户自由使用、修改和分发。
开源状态
作为开源项目,FlashInfer 在 GitHub 上公开,目前拥有 5876 颗星标,社区活跃。










评论
暂无评论
成为第一个评论的人