[新闻] GPT-5.5 API 价格翻倍 强调成本效益更高

楼主: arsl400 (dark hatter)   2026-04-24 09:02:44
GPT-5.5 API 价格翻倍 强调成本效益更高
连结:https://reurl.cc/3kMegV
时间:2026年4月24日周五 上午6:14
记者署名:Doris
原文内容:OpenAI 正式发布了 GPT-5.5 代理式模型,声称其达到了“用于实际工作和驱动代理程式
的新一代智能”。这款模型旨在自主执行复杂任务,能够跨多种工具独立完成工作,并检
查其自身的输出。尽管其 API 价格比上一代模型翻倍,但 OpenAI 强调 GPT-5.5 在效率
上有所提升。目前,GPT-5.5 已向付费的 ChatGPT 及 Codex 用户开放。
提升代理式工作流程与长上下文处理能力
OpenAI 表示,GPT-5.5 在程式码编写与除错、网络研究、数据分析、文件与试算表创建
,以及软件操作方面表现突出。该模型能够独立地在不同工具之间切换,直至任务完成。
OpenAI 指出,GPT-5.5 的主要提升集中在代理式程式设计、电脑使用、知识工作和早期
科学研究等四个领域,这些都需要跨情境推理和长时间执行动作的能力。在针对代理式工
作流程的 Terminal-Bench 2.0 编码基准测试中,GPT-5.5 取得 82.7% 的分数,超越前
身 GPT-5.4 的 75.1%,同时在困难数学问题上的优势更为明显。此外,GPT-5.5 的长上
下文处理能力也大幅改善,在 MRCR v2 基准测试中,其在 512K 至 1M Token 的上下文
长度下,准确率从 GPT-5.4 的 36.6% 跃升至 74.0%。
优势并非全面性
然而,GPT-5.5 的优势并非全面性。在测试实际 GitHub 问题解决能力的 SWE-Bench
Pro 基准测试中,Anthropic 的 Claude Opus 4.7 以 64.3% 的分数超越 GPT-5.5 的
58.6%。在由 Scale AI 执行的工具使用基准测试 MCP Atlas 中,GPT-5.5 获得 75.3%,
仍落后于 Claude Opus 4.7 (79.1%) 和 Gemini 3.1 Pro (78.2%)。同时发布的
GPT-5.5 Pro 型号,旨在作为更强大的“研究伙伴”,特别适合处理大量上下文的复杂工
作负载。在网络安全能力方面,OpenAI 将 GPT-5.5 归类为“高”,并表示其在
CyberGym 基准测试中相较 GPT-5.4 有所改善,达到 81.8%。
心得/评论:
刚刚测试了一下,推理能力真的有上来,之前被酸openai要下去了,这个版本要重返荣耀
了吗?
作者: moneywinner2 (曼尼苏)   2026-04-24 09:09:00
Chatgpt 早就不用了 烂到有剩
作者: herculus6502 (金麟岂是池中物)   2026-04-24 09:27:00
有竞争是好事 不过claude我大哥
作者: DrowningPool (My broken dreams)   2026-04-24 12:07:00
现在Genimi 比较废

Links booklink

Contact Us: admin [ a t ] ucptt.com