Product
上個月重構後端時,我一直在換模型,以為總有一個能神奇地解決問题。
後來我意識到:我不是在把它们當成各有所長的協作者,而是在找萬能鑰匙。
最强的模型不一定赢
我用过 Sonnet 4.5、Opus 4.5,還有 Codex 的 GPT-5.3 Extreme High。账面上看,你會觉得最先進的那個应該最好。
實際情況不是這樣的。
Sonnet 在後端 debug 和重構時表現极强。它的 context 處理能力让它不會陷入"打补丁"式的记憶陷阱。
Opus 有時會有特別机靈的時刻。它能調用 Sonnet 沒有的知識,突破我一個人解決不了的瓶颈。
但大部分時間,我面對的不是那種扭曲的難题。我在修路由逻辑、清理狀態管理,或者處理邊界情況。
好習惯抵消额外火力
如果我提前做好技術地圖——常见架構、模型取舍、可調參數——我就不那麼需要 Opus 的独特優勢。
這就像和人合作。資歷深不一定產出更好。有時候我需要的是 context 强、對專業领域有洞察、能扎實解決實战問题的人——那就是 Sonnet。
Opus 給我的感觉更娇氣。問题剛好對路時它很亮眼,但日常 sprint 我沒法指望它。
Codex 让我意外
Codex GPT-5.3 的扎實超出我预期。
第一:它不會过度承诺。不確定的事它會說清楚。
第二:完成度更高。當我的指令不夠准確、還存在一些發挥空間時,它會處理得很好,或者會進一步追問,而不是瞎猜。
有個有意思的事:做 web prototype 時,有些模型做出來的东西一看就是 AI 做的,风格特征太明顯。Codex 寫出來的代碼感觉更中性。
第三:協作逻辑更好。Codex 明顯经过更多交互反饋训練,知道 agent 協作時不該互相打架。Anthropic 的其他模型如果任務範圍有 overlap,會互相改來改去停不下來。Codex 知道什麼時候該收手。
我現在怎麼用這些模型
Sonnet 4.5 是我的 go-to model,尤其是 debug。很 geeky,很堅韧,像個有工兵精神的中堅力量,能 fire through problems。
Codex 像個很诚恳、很想貢献代碼的工程师。回答扎實,不會擅自退回,有時還能給出很有洞察力的建議。
Opus 比較特殊。它會擅自做決定,遇到錯误直接 roll back,任務沒有高效完成,最後還說"沒問题"。
和 AI 合作,像是在和自己合作
最让我意外的是:和 coding agent 磨合,變成了照见自己思考过程的镜子。
觉得低效時,通常不是模型的問题,而是放大了我自己计划中的漏洞:
- 工作流程有沒有提前规划?
- 是不是把問题过度复雜化了?
- 最终目標想清楚了吗?
這個过程让我想起随机梯度下降。好的優化过程不會第一步就直接收敛,而是通过随机性和適當的步長,能從不同起點穩健地找到接近最優的解,避免困在局部最優裡。
和 AI 合作如果做對了,就是這種感觉。它會浮現出我思考不清晰的地方,破除我过去抱著的幌子——比如盲目迷信大模型,就像人總會迷信權威或頭衔一樣。
沒有什麼是"一定最好",更多的是"適合"。就像打牌:你不需要全都摸到大王,關鍵是把合適的牌放到合適的位置。
想清楚了,做起來反而沒那麼難。有意思的是,很多時候在做的过程中,你才意識到自己沒想清楚。
一开始只是個想法。但做的过程會反复打磨它,一直追問:"是這樣吗?真的是這樣吗?"
你越往下走,這個事情本身就會告诉你它說不說得通。做多了以後,我不太在意別人同不同意,或者友善的支持。
那些當然好。但做到後面,自己心裡是知道的。
Do you believe in it?
這不是行銷,是我們自己踩過的坑。