项目简介
LMCache 是一个开源的 KV 缓存层,旨在通过复用注意力状态来提升 LLM 服务的性能。它能够跨请求和引擎重用 KV 缓存,从而减少重复计算,降低首字延迟,特别适用于长上下文和 RAG(检索增强生成)工作负载。
核心功能
- 跨请求复用 KV 缓存:在不同请求之间共享注意力状态,避免重复计算。
- 跨引擎兼容:支持多个推理引擎,便于集成到现有系统。
- 降低首字延迟:通过缓存复用,加速响应速度。
技术栈与许可证
该项目主要使用 Python 编写,遵循 Apache-2.0 许可证。截至采集时,GitHub 星标数为10183。
如何上手
根据 README,用户可以通过克隆仓库并安装依赖来开始使用。具体安装和配置步骤请参考项目文档。










评论
暂无评论
成为第一个评论的人