16/08/2026
這兩天 reddit 的 AI 圈最新話題,應該就是 Qwen3.8-27b 這個最新推出的本地端 LLM。
所謂的本地端 LLM ,用最淺顯的話來講,就是 LLM 整個運算都在你家的電腦上,就算是斷網也可以持續聊天解任務。許多人都在傳這句話:「Claude Opus 4.6 (max) 已經可以搬到你的個人電腦了!」
這句話的意思是,Qwen3.8-27b 具有與 Claude Opus 4.6 (max) 的同級能力。
看著網友分享的各種技術文,許多細節我也不太懂。於是,我就跟 Fable 提了,同時請它調查一下,我們自己能不能跑,Qwen 夠不夠格當你的頭號小弟?
Fable 看了一下,很爽快地跟我說沒問題,而且也很看好這位小弟。
第一次測試回應速度,Fable 說比預期慢。從過往的經驗,我感受到大型語言模型最不熟悉地就是「如何去操控自己的同胞」,因此,我立即叫它派出 Grok/Gemini 去查論壇心得。
果然,查完一輪後,軟體及設置改了一下,回應速度就上來了,逼進預期區間的下限值。
接下來,我就說 Fable 幫我做測試,將目前手上常見的任務,一一拆解後丟給它執行,並且紀下執行成果。Fable 還記得它的使命,下一刻立刻就把這個任務發包給 Codex Sol。於是,我就看著 Codex 開始很有耐心且嚴格地測試新小弟(很符合 Codex 的風格)。
一開始測 coding 能力,我在旁邊偷看,結果前 2 輪都失敗,而且失敗的原因是 Qwen 的回應被「思考推理」塞滿了。正當 Codex 準備繼續照著計畫往下測時,我切回 Fable 視窗,才發現 Fable 也和我一樣在盯著 Codex 的測試,而且 Fable 已經先把結論寫下來:
「證明了 thinking 模型不適合當 coding 工人」
這時我又忍不住了。我跟 Fable 說,要不要叫你的小弟再出去查一輪?我在社群上有看到分享 coding 成功的文章。
結果查完後,Fable 跟我說,我們踩到了社群上的坑:思考軌先吃光配額。接著 Fable 將社群解法丟給 Codex,果然,下一輪就成功地得到了產出內容。
只是,這個內容被 Codex Sol 評為不通過,又是另一個故事了。
目前還繼續在做各種測試,我只是在想,用 Fable 及 Sol 來考核它,會不會太嚴格了點?