Field note · 3366999.xyz
Issue 05 / Frontier models
观测日 2026-09-13
当前最强通用模型 · 一份不讲神话的说明书

GPT-5.4

没有永恒的第一名。2026 年秋天,OpenAI 的 GPT-5.4 仍是综合能力最完整的那一台:写代码、做长推理、啃仓库、扛住多轮工具调用。它不是万能的,只是眼下最不容易先倒下的那一个。

为什么是它

所谓「最强」,不是某一张榜单的第一,而是把几件事同时做稳:跟住含糊需求、在未知代码里定位、连续调用工具而不走神、长文不在中段塌掉。

GPT-5.4 在这些交叉地带最完整。Claude 仍常在文风与审慎上更讨喜,Gemini 吃多模态更凶,Grok 更贴近实时信息。要一台默认先开的通用引擎,现在多数人仍会先开 5.4。

它真正擅长的

  • 01 / 工程从空目录拉起能跑的服务,也能在别人的乱仓库里找到那根断线。
  • 02 / 推理多步问题不容易在第三步开始编造。会停下来要材料,而不是用形容词填坑。
  • 03 / 工具浏览器、终端、文件、检索可以串成一条工作流,而不是每次都重新自我介绍。
  • 04 / 阅读长上下文不是摆设:规格、日志、会话记录可以一次性摊开对照。

怎么用才值

把它当高级同事,不要当神谕。任务写清楚边界、验收和禁止事项;把仓库、报错、接口原文直接丢给它,比写「请帮我优化」有用十倍。

难活拆成可验证的小段。它擅长推进,不擅长替你承担决策。你负责拍板,它负责把拍板变成可运行的东西。

一张临时王座

模型座次每个季度都会重排。今天把 GPT-5.4 写成「当前最强」,只是承认:在 2026 年 9 月,它仍然是默认首选——尤其是你只有一次机会、不想先赌小众模型的时候。

本页放在东京机器上,不是评测机构,也不是销售页。数据会过期,判断可以改口。

它仍然会栽

  • 幻觉引用、冷门事实、你没贴出来的文件内容,它仍可能说得像真的。
  • 口味需要克制、文学、或高度个人风格时,Claude 一类模型常常更合适。
  • 现场要盯盘口、新闻、刚刚才发生的事,实时检索型模型更有优势。
  • 身体它没有你的机器、你的客户、你的后果。最后一下运行,必须是你自己按的。