开發的过程也是在照见自己

我曾以為最强的模型就能產出最好的結果。後來發現和 AI 智能體合作就像和人合作:契合度比火力重要,低效往往暴露的是我自己思考的漏洞。

Product

上個月重構後端時,我一直在換模型,以為總有一個能神奇地解決問题。

後來我意識到:我不是在把它们當成各有所長的協作者,而是在找萬能鑰匙。

最强的模型不一定赢

我用过 Sonnet 4.5、Opus 4.5,還有 Codex 的 GPT-5.3 Extreme High。账面上看,你會觉得最先進的那個应該最好。

實際情況不是這樣的。

Sonnet 在後端 debug 和重構時表現极强。它的 context 處理能力让它不會陷入"打补丁"式的记憶陷阱。

Opus 有時會有特別机靈的時刻。它能調用 Sonnet 沒有的知識,突破我一個人解決不了的瓶颈。

但大部分時間,我面對的不是那種扭曲的難题。我在修路由逻辑、清理狀態管理,或者處理邊界情況。

好習惯抵消额外火力

如果我提前做好技術地圖——常见架構、模型取舍、可調參數——我就不那麼需要 Opus 的独特優勢。

這就像和人合作。資歷深不一定產出更好。有時候我需要的是 context 强、對專業领域有洞察、能扎實解決實战問题的人——那就是 Sonnet。

Opus 給我的感觉更娇氣。問题剛好對路時它很亮眼,但日常 sprint 我沒法指望它。

Codex 让我意外

Codex GPT-5.3 的扎實超出我预期。

第一:它不會过度承诺。不確定的事它會說清楚。

第二:完成度更高。當我的指令不夠准確、還存在一些發挥空間時,它會處理得很好,或者會進一步追問,而不是瞎猜。

有個有意思的事:做 web prototype 時,有些模型做出來的东西一看就是 AI 做的,风格特征太明顯。Codex 寫出來的代碼感觉更中性。

第三:協作逻辑更好。Codex 明顯经过更多交互反饋训練,知道 agent 協作時不該互相打架。Anthropic 的其他模型如果任務範圍有 overlap,會互相改來改去停不下來。Codex 知道什麼時候該收手。

我現在怎麼用這些模型

Sonnet 4.5 是我的 go-to model,尤其是 debug。很 geeky,很堅韧,像個有工兵精神的中堅力量,能 fire through problems。

Codex 像個很诚恳、很想貢献代碼的工程师。回答扎實,不會擅自退回,有時還能給出很有洞察力的建議。

Opus 比較特殊。它會擅自做決定,遇到錯误直接 roll back,任務沒有高效完成,最後還說"沒問题"。

和 AI 合作,像是在和自己合作

最让我意外的是:和 coding agent 磨合,變成了照见自己思考过程的镜子。

觉得低效時,通常不是模型的問题,而是放大了我自己计划中的漏洞:

  1. 工作流程有沒有提前规划?
  2. 是不是把問题过度复雜化了?
  3. 最终目標想清楚了吗?

這個过程让我想起随机梯度下降。好的優化过程不會第一步就直接收敛,而是通过随机性和適當的步長,能從不同起點穩健地找到接近最優的解,避免困在局部最優裡。

和 AI 合作如果做對了,就是這種感觉。它會浮現出我思考不清晰的地方,破除我过去抱著的幌子——比如盲目迷信大模型,就像人總會迷信權威或頭衔一樣。

沒有什麼是"一定最好",更多的是"適合"。就像打牌:你不需要全都摸到大王,關鍵是把合適的牌放到合適的位置。

想清楚了,做起來反而沒那麼難。有意思的是,很多時候在做的过程中,你才意識到自己沒想清楚。

一开始只是個想法。但做的过程會反复打磨它,一直追問:"是這樣吗?真的是這樣吗?"

你越往下走,這個事情本身就會告诉你它說不說得通。做多了以後,我不太在意別人同不同意,或者友善的支持。

那些當然好。但做到後面,自己心裡是知道的。

Do you believe in it?

這不是行銷,是我們自己踩過的坑。

下載 macOS 版 Reso

閱讀更多 Reso 開發歷程