プロジェクト概要
vllm-mlx は、Apple Silicon デバイス向けに設計されたネイティブ MLX 推論サーバーです。OpenAI および Anthropic の API と互換性があり、既存アプリケーションへの統合が容易です。
主な機能
- テキストモデルと視覚言語モデルに対応
- 連続バッチ処理(continuous batching)
- OpenAI および Anthropic の API 仕様と互換
パフォーマンス
README によると、M1 Ultra 上で毎秒400トークン以上の生成速度を達成可能で、ローカル開発やプライバシー重視のデプロイに適しています。
技術スタックとライセンス
主要なプログラミング言語は Python で、ライセンスは Apache-2.0 です。
はじめに
具体的なインストール方法や利用手順については、プロジェクトの README ドキュメントを参照してください。










コメント
コメントはまだありません
最初のコメントを書きましょう