项目简介
vllm-mlx 是一个原生 MLX 推理服务器,专门为 Apple Silicon 设备设计,提供 OpenAI 和 Anthropic API 兼容性,便于集成到现有应用中。
核心功能
- 支持文本和视觉语言模型
- 连续批处理(continuous batching)
- API 兼容 OpenAI 和 Anthropic 规范
性能表现
根据 README 宣称,在 M1 Ultra 上可实现每秒超过400个 token 的生成速度,适用于本地开发和隐私敏感型部署。
技术栈与许可证
主要编程语言为 Python,许可证为 Apache-2.0。
上手指南
具体安装与使用步骤请参考项目 README 文档。










评论
暂无评论
成为第一个评论的人