項目簡介
vllm-mlx是一個原生MLX推理伺服器,專門為Apple Silicon設備設計,提供OpenAI和Anthropic API兼容性,便於集成到現有應用中。
核心功能
- 支持文本和視覺語言模型
- 連續批處理(continuous batching)
- API兼容OpenAI和Anthropic規範
性能表現
根據README宣稱,在M1 Ultra上可實現每秒超過400個token的生成速度,適用於本地開發和隱私敏感型部署。
技術棧與許可證
主要程式語言為Python,許可證為Apache-2.0。
上手指南
具體安裝與使用步驟請參考項目README文檔。










評論
暫無評論
成為第一個評論的人