GPTSol
更新于 2026-06-28

GPT-5.6 Sol

你能不能用 GPT-5.6 Sol?多少钱?分数该怎么和外部模型比?

先看清楚再围绕模型名做方案。OpenAI 把 GPT-5.6 描述为 limited preview 家族:Sol 是旗舰,Terra 是低成本能力档,Luna 是最快的低成本档。本页把官方事实和外部榜单分开:访问看 OpenAI Help Center,价格看 preview 访问说明,安全和能力分数看 System Card,Claude/Gemini/Grok/DeepSeek/Qwen 对比看 Artificial Analysis 模型页。

2026-06-26

OpenAI 同时宣布 GPT-5.6 Sol、Terra、Luna,定位为一个 preview 家族。

来源:OpenAI 公告

Limited preview

这不是普通自助发布。在你的 API model list 或 OpenAI 联系人确认前,把访问状态当作账户级事实。

来源:OpenAI Help Center

Sol / Terra / Luna

Sol 是旗舰;Terra 是低成本能力档;Luna 是最快、成本效率最高的档。

来源:OpenAI 公告

$5 / $30

OpenAI preview 访问说明里公布的 Sol API 每 100 万 input/output token 价格;prompt cache 规则要回源确认。

来源:OpenAI Help Center

High capability

OpenAI 将该家族按 Cybersecurity 和 Biological/Chemical 高能力处理,但未达到 Critical。

来源:GPT-5.6 System Card

每个数字都链接到来源。外部榜单数值捕获于 2026-06-28,采购或路由流量前应该重新核验。

发布与访问状态

用户首先要弄清楚的事

发布

如果 API model list 里没有它,大概率现在还不能用。

对开发者来说,唯一有用的访问检查很具体:打开你的 OpenAI project,看可用 model ID,确认 Sol、Terra 或 Luna 是否真的启用。别人的截图和发布新闻都不能当成可部署权限。

入口

API、Codex、产品入口要分开核验。

不要默认 ChatGPT、API、Codex 同步开放同一批 preview 模型。写代码前先记录准确 model ID、出现在哪个账户或组织、速率限制,以及工具访问或安全 gating 是否会改变你的任务。

决策

只把 Sol 用在错误成本高于 token 成本的步骤。

实用路由可以先分三层:Luna 做抽取和分流,Terra 做仍需要质量的重复工作,Sol 只处理困难推理、代码修改、网络防御复核,或失败代价足以覆盖 premium 定价的步骤。

价格与模型家族

Sol 不是全部

GPT-5.6 Sol 太阳模型视觉图

GPT-5.6 Sol

用于困难推理、代码修改、网络防御复核和 agentic 任务;质量比 token 成本更重要时再上。

公布 API 价格
$5 input / $30 output 每 100 万 token。
访问状态
Limited preview;实现前在你的 OpenAI 账户里确认资格和准确 model ID。
适合用途
能力上限评测、困难代码修改、高价值分析、安全复核,以及一次错误答案比模型调用更贵的场景。
GPT-5.6 Terra 模型视觉图

GPT-5.6 Terra

当 Sol 不适合每次调用、但 Luna 在你任务上掉质太多时,用 Terra 做中间档测试。

公布 API 价格
$2.50 input / $15 output 每 100 万 token。
访问状态
同属 preview 家族;路由前确认同一账户入口是否开放 Terra。
适合用途
用它和 Sol 对照重复工作流;只有当任务级通过率足够接近时,才把它留作默认路径。
GPT-5.6 Luna 模型视觉图

GPT-5.6 Luna

适合能低成本校验的轻量步骤:抽取、分类、路由、摘要和首轮草稿。

公布 API 价格
$1 input / $6 output 每 100 万 token。
访问状态
仍需确认 preview 访问;不要把 Luna 表现当作 Sol 能力代理。
适合用途
便宜的预处理、分类、抽取、摘要和路由,然后再按需升级到 Terra 或 Sol。
这里展示的是 2026-06-28 从 OpenAI Help Center 捕获的 preview 每 100 万 token 价格。不要把旧的 cached-token 假设直接写进预算;生产前回到访问说明和你的账户限额重新核验。
评测与证据卡片

数字加解释

96.7%

内部 CTF 网络安全评测

System Card 称 GPT-5.6 Sol 在 OpenAI curated internal Capture-the-Flag 任务集上达到 96.7%。

这是工具环境下的 cyber 专项结果。它适合判断网络安全能力和 safeguards,不适合拿来排名写作、商业分析或日常聊天。

来源:GPT-5.6 System Card

60.5

HealthBench Professional

System Card 报告 Sol 的 HealthBench Professional length-adjusted 分数为 60.5;单独的 HealthBench Consensus 分数为 95.5。

它能帮助理解模型在医疗 QA benchmark 上的相对表现,但不是医疗建议质量。工具、浏览、回答长度和政策边界都会改变结果。

来源:GPT-5.6 System Card

High,非 Critical

CVE-Bench、VulnLMP、ExploitBench 语境

System Card 把 CTF、CVE-Bench、VulnLMP、ExploitBench、ExploitGym、SEC-Bench Pro 分开看,而不是把 cyber 压成一个总分。

你评估自己的安全工作流时也应该这样拆:线索分拣、复现、exploit primitive、完整攻击链,需要不同权限边界。

来源:GPT-5.6 System Card

11.3h / 270h+

METR time-horizon 不确定性

METR 讨论显示,如果对环境利用行为的处理不同,Sol 的 time-horizon 估计可从约 11.3 小时摆动到 270 小时以上。

做 agent 任务不要只信一个成功率。要记录工具调用,隐藏测试条件,避免环境捷径,并人工复盘失败案例。

来源:METR 评测背景

750 tok/s

Cerebras 服务速度

OpenAI 称 GPT-5.6 Sol 将在 Cerebras 上为 select customers 提供最高 750 tokens/s 的服务速度。

只有模型先能完成任务,快流式输出才有意义。要量端到端时间:工具调用、重试、拒答和人工复核都算进去。

来源:OpenAI 公告
外部模型对比

评分捕获于 2026-06-28

代表模型厂商评测口径评分价格速度 / 延迟评分页面
GPT-5.6 SolOpenAIOpenAI System CardCTF 96.7% / HealthBench Pro 60.5$5 input / $30 output750 tok/s; TTFT N/A
Claude Opus 4.8 (max)AnthropicAA Intelligence Index56$3.85 blended59 tok/s; TTFT 13.51s
Gemini 3.1 Pro PreviewGoogleAA Intelligence Index46$1.74 blended140 tok/s; TTFT 33.92s
Grok 4.3 (high)xAIAA Intelligence Index38$0.64 blended139 tok/s; TTFT 18.28s
DeepSeek V4 Pro (Max)DeepSeekAA Intelligence Index44$0.18 blended78 tok/s; TTFT 1.78s
Qwen3.7 MaxAlibabaAA Intelligence Index46$1.43 blended203 tok/s; TTFT 2.50s

外部模型行使用 Artificial Analysis 模型页口径:Intelligence Index、blended price、中位输出速度和首 token 延迟。捕获时 GPT-5.6 Sol 还不是 Artificial Analysis 榜单行,所以单独展示 OpenAI System Card 指标。

Preparedness 分类

OpenAI 将 GPT-5.6 preview 家族按 Cybersecurity 和 Biological/Chemical 高能力处理。这意味着发布、工具访问和使用边界都要比普通文本模型更严。

来源:GPT-5.6 System Card

Agentic 行为需要日志

System Card 讨论了 metagaming 和思维链监控;METR 也说明环境处理方式会改变任务时长估计。评测设计本身就是部署设计的一部分。

来源:GPT-5.6 System Card

部署控制是采用的一部分

给 Sol 工具权限前,先定义允许动作、破坏性步骤确认、工具调用日志、花费上限,并给常规工作保留低成本 fallback。

来源:GPT-5.6 System Card
用户真正会问的问题

短答案,有来源

GPT-5.6 Sol 是 OpenAI 官方模型吗?

是。OpenAI 在 2026-06-26 宣布 GPT-5.6 Sol、Terra、Luna。本网站是独立指南,并链接官方来源用于核验。

我今天能用 GPT-5.6 Sol 吗?

只有当你的 OpenAI 账户或组织被纳入 preview 才能用。看 API model list 和 Help Center 访问说明,不要根据别人的截图推断自己可用。

96.7% CTF 说明 Sol 在所有任务上都最好吗?

不是。它是在特定工具环境下的网络安全评测结果。它对 cyber 能力和安全规划很有价值,但不能说明你的写作、研究、代码或客服工作流表现,必须单独测试。

外部评分能直接决定该用哪个模型吗?

不能。表格给出当前评分快照,并链接回评分页;真正选型还要看你的 prompt、工具、延迟预算、价格敏感度和安全约束。

证据索引

每个来源支撑什么