开发的过程也是在照见自己

我曾以为最强的模型就能产出最好的结果。后来发现和 AI 智能体合作就像和人合作:契合度比火力重要,低效往往暴露的是我自己思考的漏洞。

Product

上个月重构后端时,我一直在换模型,以为总有一个能神奇地解决问题。

后来我意识到:我不是在把它们当成各有所长的协作者,而是在找万能钥匙。

最强的模型不一定赢

我用过 Sonnet 4.5、Opus 4.5,还有 Codex 的 GPT-5.3 Extreme High。账面上看,你会觉得最先进的那个应该最好。

实际情况不是这样的。

Sonnet 在后端 debug 和重构时表现极强。它的 context 处理能力让它不会陷入"打补丁"式的记忆陷阱。

Opus 有时会有特别机灵的时刻。它能调用 Sonnet 没有的知识,突破我一个人解决不了的瓶颈。

但大部分时间,我面对的不是那种扭曲的难题。我在修路由逻辑、清理状态管理,或者处理边界情况。

好习惯抵消额外火力

如果我提前做好技术地图——常见架构、模型取舍、可调参数——我就不那么需要 Opus 的独特优势。

这就像和人合作。资历深不一定产出更好。有时候我需要的是 context 强、对专业领域有洞察、能扎实解决实战问题的人——那就是 Sonnet。

Opus 给我的感觉更娇气。问题刚好对路时它很亮眼,但日常 sprint 我没法指望它。

Codex 让我意外

Codex GPT-5.3 的扎实超出我预期。

第一:它不会过度承诺。不确定的事它会说清楚。

第二:完成度更高。当我的指令不够准确、还存在一些发挥空间时,它会处理得很好,或者会进一步追问,而不是瞎猜。

有个有意思的事:做 web prototype 时,有些模型做出来的东西一看就是 AI 做的,风格特征太明显。Codex 写出来的代码感觉更中性。

第三:协作逻辑更好。Codex 明显经过更多交互反馈训练,知道 agent 协作时不该互相打架。Anthropic 的其他模型如果任务范围有 overlap,会互相改来改去停不下来。Codex 知道什么时候该收手。

我现在怎么用这些模型

Sonnet 4.5 是我的 go-to model,尤其是 debug。很 geeky,很坚韧,像个有工兵精神的中坚力量,能 fire through problems。

Codex 像个很诚恳、很想贡献代码的工程师。回答扎实,不会擅自退回,有时还能给出很有洞察力的建议。

Opus 比较特殊。它会擅自做决定,遇到错误直接 roll back,任务没有高效完成,最后还说"没问题"。

和 AI 合作,像是在和自己合作

最让我意外的是:和 coding agent 磨合,变成了照见自己思考过程的镜子。

觉得低效时,通常不是模型的问题,而是放大了我自己计划中的漏洞:

  1. 工作流程有没有提前规划?
  2. 是不是把问题过度复杂化了?
  3. 最终目标想清楚了吗?

这个过程让我想起随机梯度下降。好的优化过程不会第一步就直接收敛,而是通过随机性和适当的步长,能从不同起点稳健地找到接近最优的解,避免困在局部最优里。

和 AI 合作如果做对了,就是这种感觉。它会浮现出我思考不清晰的地方,破除我过去抱着的幌子——比如盲目迷信大模型,就像人总会迷信权威或头衔一样。

没有什么是"一定最好",更多的是"适合"。就像打牌:你不需要全都摸到大王,关键是把合适的牌放到合适的位置。

想清楚了,做起来反而没那么难。有意思的是,很多时候在做的过程中,你才意识到自己没想清楚。

一开始只是个想法。但做的过程会反复打磨它,一直追问:"是这样吗?真的是这样吗?"

你越往下走,这个事情本身就会告诉你它说不说得通。做多了以后,我不太在意别人同不同意,或者友善的支持。

那些当然好。但做到后面,自己心里是知道的。

Do you believe in it?

这不是营销,是我们自己踩过的坑。

下载 macOS 版 Reso

阅读更多 Reso 构建日志