2026-06-26
OpenAI 同时宣布 GPT-5.6 Sol、Terra、Luna,定位为一个 preview 家族。
来源:OpenAI 公告GPT-5.6 Sol 事实表,附来源链接
你能不能用 GPT-5.6 Sol?多少钱?分数该怎么和外部模型比?
先看清楚再围绕模型名做方案。OpenAI 把 GPT-5.6 描述为 limited preview 家族:Sol 是旗舰,Terra 是低成本能力档,Luna 是最快的低成本档。本页把官方事实和外部榜单分开:访问看 OpenAI Help Center,价格看 preview 访问说明,安全和能力分数看 System Card,Claude/Gemini/Grok/DeepSeek/Qwen 对比看 Artificial Analysis 模型页。
2026-06-26
OpenAI 同时宣布 GPT-5.6 Sol、Terra、Luna,定位为一个 preview 家族。
来源:OpenAI 公告Limited preview
这不是普通自助发布。在你的 API model list 或 OpenAI 联系人确认前,把访问状态当作账户级事实。
来源:OpenAI Help CenterSol / Terra / Luna
Sol 是旗舰;Terra 是低成本能力档;Luna 是最快、成本效率最高的档。
来源:OpenAI 公告$5 / $30
OpenAI preview 访问说明里公布的 Sol API 每 100 万 input/output token 价格;prompt cache 规则要回源确认。
来源:OpenAI Help CenterHigh capability
OpenAI 将该家族按 Cybersecurity 和 Biological/Chemical 高能力处理,但未达到 Critical。
来源:GPT-5.6 System Card96.7%
Sol 在 OpenAI 内部 CTF cyber eval 中接近饱和;这不是所有任务的通用分数。
来源:GPT-5.6 System Card每个数字都链接到来源。外部榜单数值捕获于 2026-06-28,采购或路由流量前应该重新核验。
用户首先要弄清楚的事
对开发者来说,唯一有用的访问检查很具体:打开你的 OpenAI project,看可用 model ID,确认 Sol、Terra 或 Luna 是否真的启用。别人的截图和发布新闻都不能当成可部署权限。
不要默认 ChatGPT、API、Codex 同步开放同一批 preview 模型。写代码前先记录准确 model ID、出现在哪个账户或组织、速率限制,以及工具访问或安全 gating 是否会改变你的任务。
实用路由可以先分三层:Luna 做抽取和分流,Terra 做仍需要质量的重复工作,Sol 只处理困难推理、代码修改、网络防御复核,或失败代价足以覆盖 premium 定价的步骤。
Sol 不是全部
用于困难推理、代码修改、网络防御复核和 agentic 任务;质量比 token 成本更重要时再上。
当 Sol 不适合每次调用、但 Luna 在你任务上掉质太多时,用 Terra 做中间档测试。
适合能低成本校验的轻量步骤:抽取、分类、路由、摘要和首轮草稿。
数字加解释
96.7%
System Card 称 GPT-5.6 Sol 在 OpenAI curated internal Capture-the-Flag 任务集上达到 96.7%。
这是工具环境下的 cyber 专项结果。它适合判断网络安全能力和 safeguards,不适合拿来排名写作、商业分析或日常聊天。
来源:GPT-5.6 System Card60.5
System Card 报告 Sol 的 HealthBench Professional length-adjusted 分数为 60.5;单独的 HealthBench Consensus 分数为 95.5。
它能帮助理解模型在医疗 QA benchmark 上的相对表现,但不是医疗建议质量。工具、浏览、回答长度和政策边界都会改变结果。
来源:GPT-5.6 System CardHigh,非 Critical
System Card 把 CTF、CVE-Bench、VulnLMP、ExploitBench、ExploitGym、SEC-Bench Pro 分开看,而不是把 cyber 压成一个总分。
你评估自己的安全工作流时也应该这样拆:线索分拣、复现、exploit primitive、完整攻击链,需要不同权限边界。
来源:GPT-5.6 System Card11.3h / 270h+
METR 讨论显示,如果对环境利用行为的处理不同,Sol 的 time-horizon 估计可从约 11.3 小时摆动到 270 小时以上。
做 agent 任务不要只信一个成功率。要记录工具调用,隐藏测试条件,避免环境捷径,并人工复盘失败案例。
来源:METR 评测背景750 tok/s
OpenAI 称 GPT-5.6 Sol 将在 Cerebras 上为 select customers 提供最高 750 tokens/s 的服务速度。
只有模型先能完成任务,快流式输出才有意义。要量端到端时间:工具调用、重试、拒答和人工复核都算进去。
来源:OpenAI 公告评分捕获于 2026-06-28
| 代表模型 | 厂商 | 评测口径 | 评分 | 价格 | 速度 / 延迟 | 评分页面 |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | OpenAI | OpenAI System Card | CTF 96.7% / HealthBench Pro 60.5 | $5 input / $30 output | 750 tok/s; TTFT N/A | |
| Claude Opus 4.8 (max) | Anthropic | AA Intelligence Index | 56 | $3.85 blended | 59 tok/s; TTFT 13.51s | |
| Gemini 3.1 Pro Preview | AA Intelligence Index | 46 | $1.74 blended | 140 tok/s; TTFT 33.92s | ||
| Grok 4.3 (high) | xAI | AA Intelligence Index | 38 | $0.64 blended | 139 tok/s; TTFT 18.28s | |
| DeepSeek V4 Pro (Max) | DeepSeek | AA Intelligence Index | 44 | $0.18 blended | 78 tok/s; TTFT 1.78s | |
| Qwen3.7 Max | Alibaba | AA Intelligence Index | 46 | $1.43 blended | 203 tok/s; TTFT 2.50s |
外部模型行使用 Artificial Analysis 模型页口径:Intelligence Index、blended price、中位输出速度和首 token 延迟。捕获时 GPT-5.6 Sol 还不是 Artificial Analysis 榜单行,所以单独展示 OpenAI System Card 指标。
OpenAI 将 GPT-5.6 preview 家族按 Cybersecurity 和 Biological/Chemical 高能力处理。这意味着发布、工具访问和使用边界都要比普通文本模型更严。
来源:GPT-5.6 System CardSystem Card 讨论了 metagaming 和思维链监控;METR 也说明环境处理方式会改变任务时长估计。评测设计本身就是部署设计的一部分。
来源:GPT-5.6 System Card给 Sol 工具权限前,先定义允许动作、破坏性步骤确认、工具调用日志、花费上限,并给常规工作保留低成本 fallback。
来源:GPT-5.6 System Card短答案,有来源
是。OpenAI 在 2026-06-26 宣布 GPT-5.6 Sol、Terra、Luna。本网站是独立指南,并链接官方来源用于核验。
只有当你的 OpenAI 账户或组织被纳入 preview 才能用。看 API model list 和 Help Center 访问说明,不要根据别人的截图推断自己可用。
不是。它是在特定工具环境下的网络安全评测结果。它对 cyber 能力和安全规划很有价值,但不能说明你的写作、研究、代码或客服工作流表现,必须单独测试。
不能。表格给出当前评分快照,并链接回评分页;真正选型还要看你的 prompt、工具、延迟预算、价格敏感度和安全约束。
每个来源支撑什么
发布时间、模型家族定位、Sol/Terra/Luna 分工、limited preview 语境和 Cerebras 速度声明。
理解 OpenAI 真正宣布了什么时,先看这个,不要只看二手摘要。
System CardPreparedness 分类、CTF/CVE/VulnLMP/ExploitBench 语境、医疗评测、metagaming 和 safeguards。
这是本页数字和风险边界最重要的来源。
访问 + 价格谁能访问 preview、如何核验可用性,以及 Sol/Terra/Luna 已公布的 token 价格。
GPT-5.6 价格优先看这里;通用 API pricing 页可能滞后或不列 preview-only 模型。
评测time-horizon 测量不确定性、环境利用,以及为什么 agent 评测需要严谨方法。
这是避免简单排行榜思维的重要反证材料。
外部评分Claude、Gemini、Grok、DeepSeek、Qwen 的评分、价格、速度、延迟,以及用于核验模型身份的厂商页面。
用链接的评分页查看当前 benchmark 值,再回厂商文档确认模型身份和可用性。
访问说明账户资格、当前访问 caveat、模型家族可用性,以及 preview 专属操作说明。
写代码前先看这里;可用性比模型家族公告更容易变化。