GPT-5.6 Sol: API 新档位最高提速 14 倍

GPT-5.6 Sol: API 新档位最高提速 14 倍

Grace Sullivan
26
original

OpenAI 预告了面向 API 的新服务档位 Ultrafast, 运行 GPT-5.6 Sol 时最高可比原速提升 14 倍, 输出最高达每秒 750 tokens, 算力平台来自 Cerebras。官方页面暂未披露更多细节, 定价与开放范围仍未公布。

OpenAI 预告了一个新的 API 服务档位 Ultrafast, 核心卖点是把 GPT-5.6 Sol 的运行速度拉到原来的 14 倍。官方给出的资料很简短: 输出速度最高 每秒 750 tokens, 算力平台来自 Cerebras

需要先说明的是, 采写时 OpenAI 官方页面没有抓到实质内容, 所以下面所有信息都基于发布时提供的描述, 没有经过二次核验。好在简介本身包含的信息足够拼出一个大致轮廓。

这次“快”指的是什么

从字面看, Ultrafast 不是模型本身的变化, 而是运行 GPT-5.6 Sol 时的一个高性能服务档位。它要解决的问题很明确: 大语言模型在 API 调用里最让人难受的等待, 往往不是“能不能答”, 而是“答得多慢”。

  • 输出速率最高 750 tokens/秒, 长回答也能更快开始流式返回
  • 整体速度相比之前提升最高 14 倍, 官方表述为 “up to” 而非恒定值
  • 由 Cerebras 提供计算支撑, 而不是 OpenAI 自研基础设施

这里有一个值得留意的细节: “最高”14 倍和“平均 14 倍”是两个概念。实际能跑多快, 还要看模型规模、输入长度、并发负载和网络条件。官方没有给出基准测试, 所以只能把它当作宣传口径。

对开发者的实际影响

对做实时对话、客服机器人或者长文档生成的团队来说, token 输出速度直接影响体验。如果 750 tokens/秒真的稳定跑出来, 一段 2000 tokens 的回答大约不到三秒就能吐完, 交互感会贴近本地推理。

不过现在下结论还太早。定价、用量配额、可用区域、是否对存量开发者开放, 这些关键问题官方都没有提。建议先别急着迁移工作流, 等到有明确的灰度测试或正式文档再动手。

下一步值得关注两件事: Ultrafast 会不会扩展到其他模型, 以及 Cerebras 与 OpenAI 的合作边界在哪里。如果这只是一次性营销演示, 意义有限; 如果成为常态档位, 那 API 市场的速度竞赛又会快一档。

总的来说, 这是一次目标明确但细节稀少的发布。速度数字很漂亮, 但真正决定它价值的, 是之后的定价、可用性和稳定性。

OpenAIUltrafastGPT-5.6 SolAPI加速Cerebras推理速度大模型APIAI新闻tokens每秒

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多

相似工具

Cursor

Cursor

一款基于 VS Code 二次开发的智能代码编辑器,以“原生内置 AI”为核心卖点。它不依赖插件,而是将 AI 深度植入编辑器底层,能够理解整个项目的上下文代码库,支持无缝迁移 VS Code 的所有配置和插件。

Google Antigravity

Google Antigravity

Antigravity 支持多模型,包括 Gemini 3 Pro、Claude Sonnet 4.5、GPT-OSS,开发者可以在同一环境中选择最适合任务的模型。

Codex

Codex

OpenAI Codex 是由 OpenAI 开发的 AI 编程模型和助手,可将自然语言指令翻译成对应的源代码,为开发者提供智能补全、代码生成等功能。它最初于 2021 年作为 OpenAI API 的代码模型推出,曾为 GitHub Copilot 提供核心支持。随着 OpenAI 技术的迭代,Codex 在 2025 年以“AI 编程智能体”的全新姿态回归,能够理解复杂需求并自动编写、调试代码,显著提升开发效率和软件交付速度。

Kiro

Kiro

Kiro 是由 AWS 推出的 AI 编程 IDE,采用规范驱动的开发模式,将自然语言需求转化为明确的规格文档和任务,再由内置 AI 代理生成代码并调试优化,全流程辅助大型项目开发。

Trae

Trae

Trae(官网 trae.ai)是由 字节跳动(ByteDance)推出的一款 AI 原生集成开发环境(IDE)。它不是简单地作为一个编程助手,而是一个「协作伙伴」,通过深度整合大型语言模型(LLM),帮助开发者从需求、构建代码,到调试和部署,实现更智能化、自动化的软件开发。

Claude

Claude

Claude 是由美国人工智能公司 Anthropic 打造的智能语言交互平台,它融合了深度文本理解、信息整理、代码辅助和任务分析等能力,能在聊天对话之外应对更复杂的问题,例如长文摘要、图像解析、逻辑推理及编程协助等。相比一些单一问答机器人,Claude 更像一个具备推理逻辑、可扩展功能的智能工具。

开源项目

guidellm:评估与优化 LLM 推理性能的开源工具

guidellm 是由 vLLM 团队开发的开源工具,用于评估和优化大型语言模型(LLM)在生产环境中的推理性能。它提供压力测试、延迟分析和吞吐量评估,帮助开发者识别瓶颈并调整部署配置。项目主要使用 Python 编写,采用 Apache-2.0 许可证,在采集时拥有 1214 个星标。

ai-gateway:基于 Envoy Gateway 的统一 AI 网关

ai-gateway 是一个基于 Envoy Gateway 的开源项目,提供统一的 API 网关来管理对多种生成式 AI 服务的访问。它简化了 AI 应用的集成与运维,支持负载均衡、缓存和速率限制等功能。项目使用 Go 语言开发,采用 Apache-2.0 许可证。

Kun:本地优先的 AI 代理工作区

Kun 是一个本地优先的 AI 代理工作区,通过共享 GUI 和 TUI 运行时统一编码、写作、设计、研究和自动化。项目主要使用 TypeScript 开发,许可证为 Other。截至采集时拥有 4813 个 GitHub 星标。

go-micro:融合 AI 与微服务的 Go 框架

go-micro 是一个开源的 Go 编程语言框架,它融合了 AI 代理工具集与微服务架构,并支持 MCP、A2A 协议以及多 LLM 集成。该项目采用 Apache-2.0 许可证,主要使用 Go 语言开发。截至采集时,该项目在 GitHub 上获得22755颗星。

terax-ai:轻量级 Tauri 桌面开发环境

terax-ai 是一个基于 Tauri 的桌面开发环境,体积仅 7-8 MB。它集成了 GPU 终端、CodeMirror 编辑器、Git 工具和多提供商 AI 代理,为开发者提供一体化的开发体验。项目主要使用 TypeScript 编写,采用 Apache-2.0 许可证。

jar-analyzer: Java JAR 包分析 GUI 工具,集成 AI 助手

jar-analyzer 是一款开源的 Java JAR 包分析 GUI 工具,集成了 AI 助手。它提供 JAR DIFF、方法调用图探索、DFS 调用链分析、污点分析以及控制流图程序分析等强大功能,适用于 Java 开发者和安全研究员,简化代码审计与逆向工程任务。项目主要语言为 Java,采用 GPL-3.0 许可证,在采集时拥有 2111 个星标。