OpenAI 一夜终结战争:GPT-5.5 改写智能体规则,GPT Image 2 让 DALL-E 直接退役

整体背景
GPT Image 2 和 GPT-5.5 是 OpenAI 在 2026 年 4 月几乎同时推出的两款新模型,但它们解决的是完全不同维度的问题。GPT Image 2 是图像生成模型,而 GPT-5.5 是通用的大语言/推理模型。
它们体现了 OpenAI 当前的两条核心技术路线,一条是"让推理能力下沉到每一种模态"(Image 2 把 O 系列推理能力首次嵌入图像生成),另一条是"让模型变成可以独立完成长链路任务的智能体"(GPT-5.5 主打 agentic coding 与计算机操作)。
GPT Image 2
核心技术突破
架构层面被完全重写。 研究负责人 Boyuan Chen 确认架构是"从头改造"的,虽然他没有明确说明模型用的是扩散模型还是自回归方法。这点很有趣,OpenAI 罕见地对架构细节保持模糊,这通常意味着他们认为这个架构本身具有竞争优势。
首次将 O 系列推理能力原生嵌入图像生成。这是它和市场上其他图像模型最本质的区别。在 Images 2.0 中最重要的架构变化是引入了所谓的"思考模式"(thinking mode)。模型不再在收到 prompt 后立即渲染图像,而是先运行一个推理循,它会规划图像构图、考虑元素之间的空间关系,甚至可以在画下第一个像素之前搜索网络获取视觉参考或事实准确性。可以这样理解这件事,传统图像模型像是一个"即兴画家",听到指令就直接动笔,而 GPT Image 2 更像是一个"会先打草稿、查资料、检查约束条件的设计师"。
文字渲染问题被基本攻克。这听起来像是小事,但其实是图像生成领域多年来的核心痛点。GPT Image 2 在标签、UI 元素、招牌和名片等场景上达到了大约 99% 的字符级准确率,并原生支持多语言文字,拉丁文、中文、日文、韩文、印地文和孟加拉文都能正确渲染。在曲面、小尺寸、复杂版式中,中日韩字符的渲染准确率超过 95%。
性能基准
在 LM Arena 文生图排行榜上,Images 2.0 拿到了 Image Arena 历史上最大的领先优势,据 MindwiredAI 报道领先 Nano Banana 2(谷歌的 Gemini 3 Pro Image)+242 个 Elo 点。具体来说,Arena 报告 GPT-Image-2 在所有 Image Arena 排行榜上都排名第一,包括文生图 1512 分、单图编辑 1513 分、多图编辑 1464 分。
安全性考量
OpenAI 在 ChatGPT Images 2.0 系统卡中直接承认,模型增强的真实感如果没有保障措施,可能让深度伪造(包括政治和敏感内容)变得更具说服力。为了应对这一点,OpenAI 实施了多层安全栈。这点值得留意,随着图像质量逼近真实,模型本身的输出过滤和水印机制就成了必须配套的基础设施。

GPT-5.5
核心能力定位
GPT-5.5 的设计理念可以这样概括,你不需要再仔细管理每一步,而是可以把一个杂乱的、多部分的任务交给它,信任它能够规划、使用工具、检查自己的工作、应对模糊性,并坚持下去直到完成。
它在智能体编码、计算机使用、知识工作和早期科学研究方面的提升尤其明显,这些领域的进步依赖于跨上下文推理和持续行动。
OpenAI 强调的一个有趣的工程权衡是,更强的智能不等于更慢的响应。通常更大、更强的模型服务速度更慢,但 GPT-5.5 在真实世界服务中的每 token 延迟与 GPT-5.4 持平,同时智能水平显著更高。
关键基准成绩
让我把数字具体化,这样你能感受到提升的量级。GPT-5.5 在 Terminal-Bench 2.0(测试需要规划、迭代和工具协调的复杂命令行工作流)上达到了 82.7% 的最先进准确率。在评估真实 GitHub 问题解决的 SWE-Bench Pro 上达到 58.6%。
在 Expert-SWE(OpenAI 内部用于长程编码任务的前沿评估,人类完成时间中位数为 20 小时)上,GPT-5.5 也优于 GPT-5.4。
不同模型之间的对比很说明问题。GPT-5.5 在 Terminal-Bench 2.0 上领先(82.7% vs 69.4%)、OSWorld-Verified(78.7% vs 78.0%)、长上下文检索(MRCR v2:74% 对比无数据)和 CyberGym(81.8% vs 73.1%)。Claude Opus 4.7 在 SWE-bench Pro(64.3% vs 58.6%)、SWE-bench Verified(87.6% 对比无数据)、无工具的 HLE(46.9% vs 41.4%)和 MCP-Atlas 工具编排(79.1% vs 75.3%)上领先。
特别值得注意的是长上下文的飞跃。长上下文推理跳跃尤为惊人:在 1M tokens 的 MRCR v2 上从 36.6%(GPT-5.4)上升到 74.0%,翻了一倍多。如果你做过涉及超长文档的工作,你会理解这个数字背后意味着什么,模型现在真的能"读完"一整本书并保持一致性,而不只是对开头和结尾有印象。
总结
Open AI 这两次发布在产业层面也带来了清晰的路线判断:OpenAI 同时宣布退役 DALL-E 全系列,意味着纯扩散范式让位于"推理+生成"统一架构,而 GPT-5.5 在 Terminal-Bench 2.0 等智能体基准上的大幅领先(82.7%)则把竞争焦点从"谁回答得更准"推向"谁能独立把活干完"。
两者合在一起,实际上把整个领域的评价标准从"单点能力指标"重塑为"长链路任务完成度",也为 OpenAI 反复提及的"super app"愿景,把 ChatGPT、Codex 与视觉生成能力整合为统一智能体,铺好了技术底座。
