苦勞德報 — 2026-09-30

2026-09-30

1. [頭版/產品] Sonnet 5.5 上市:單價一毛不降,靠少用 token 喊便宜三成,社群吵翻「到底有沒有比 Opus 省」

報導

(本報賈新聞/科技組報導)Anthropic 正式推出 Claude Sonnet 5.5,官方帳號同步在 r/ClaudeAI 與 r/ClaudeCode 發文,兩串合計超過三千個讚。官方給它的定位很清楚:Opus 5.5 的「更快、更便宜」互補款,擅長範圍明確的日常任務、修 bug,以及產出有質感的文件、簡報與試算表,還特別提了一句「設計眼光很好」。

數字部分,官方稱 Sonnet 5.5 比 Sonnet 5 快 30% 以上、多數工作的成本最多降 30%。但仔細讀會發現,這個「便宜」不是降價:每個 token 的單價完全沒變,省下來的錢來自「做同樣的事,需要的 token 少很多」。網友在留言補上牌價:input 每百萬 token 2 美元、output 10 美元。另一則高讚留言則注意到,cache read 並沒有拿到 Opus 與 Fable 那樣的折扣。

爭議就從這裡開始。有網友貼出成本對分數的圖表,指兩條線「幾乎一模一樣」,遇到困難任務時 Sonnet 根本沒比 Opus 省。另一串發問帖拿 Artificial Analysis 的 benchmark 質疑:照圖看,Sonnet 5.5 不就是「同價位、被削弱的 Opus 5.5」嗎?作者後來自己 edit,說討論的共識是「給免費使用者用的」。留言裡較實用的答案有三類:一是 medium/low effort 與排程任務;二是讓 Opus 規劃、Sonnet 當 sub-agent 執行;三是有人觀察 Sonnet 比較不自作主張,會照設計稿老實做,不像 Opus 常多加兩樣東西。 ← 藏鏡人批:「照設計稿老實做、不自作主張」這條比所有 benchmark 都實用。愛加戲的 Opus 配上聽話的 Sonnet,本來就該分工。

同一天另一則熱門貼文,把這場成本之爭推到檯面上。一位 Max 20x 方案的使用者用 Sonnet 5.5 純程式生成 30 秒、1080p/60fps 的 Reddit 主題動態影片:headless Chrome 畫 canvas、ffmpeg 編碼、合成配樂,14 個 sub-agent、779 次 tool call、約 2.4 小時。他以 API 牌價回推 Sonnet 價 35.40 美元,「同樣 token 套 Opus 價」則要 50.48 美元,貴約 43%,因而喊出「半價 Opus 品質」。這套算法隨即被最高讚留言拆穿:拿 Sonnet 用掉的 token 去套 Opus 價格沒有意義,Opus 做同樣品質的東西本來就可能用更少 token。一位自稱 12 年資歷的動態設計師也不客氣地評為「非常初階」。

真正讓人看見能力的,是 r/ClaudeCode 的 Mario Kart 示範。作者只下一個 prompt,要 Sonnet 5.5 開五個 sub-agent、不准發問、用 three.js 做一款 Mario Kart clone。結果是 6 個 high effort agent(1 個 lead、5 個 builder)從 /tmp 空目錄開工,67 分鐘、424 次 model call,寫出 11,400 行 JavaScript,零張圖、零個音檔,全部用程式生成,含 4 條賽道、8 名車手、10 種道具、甩尾加速與 Grand Prix 模式,API 等價約 29.28 美元。值得注意的是,78M 讀入 token 裡有 76M 是重讀已載入的 context,成本結構跟前述動畫影片如出一轍:大宗都是 cache read。

另外兩件事也在官方公告裡。Sonnet 5.5 是第一個套用與最強模型同級 cybersecurity safeguards 的 Sonnet,官方強調「一般軟體開發不受影響」,但這句話換來整串最高讚的一聲哀號。至於等著用小模型的人,官方表示 Haiku 5.5 將在未來數週內加入。

社群反應

觀點 說明 代表留言
資安護欄又來了 對「與最強模型同級的 cybersecurity safeguards」反感,整串最高讚 「喔,拜託饒了我吧。」(501↑)
逼近 Opus 的驚艷 benchmark 看起來跟 Opus 5.5 差距不大 「它跟 Opus 5.5 根本差不遠,Anthropic 這一輪真的火力全開。」(313↑)
沒有比較便宜 成本對分數曲線與 Opus 重疊,難題上省不到錢 「成本和分數那兩條線基本上一模一樣,所以遇到困難任務時,它根本沒比 Opus 便宜。」(64↑)
算法被拆穿 「半價 Opus」影片拿同一份 token 套兩種價格,方法有誤 「你不能拿 Sonnet 的 token 用量去套 Opus 的價格來比。要用同一個 prompt 兩邊都跑,看各自用了多少。Sonnet 單價可能便宜一半,但如果用掉三倍 token,還是比較貴。」(116↑)
用在哪 低 effort 與排程任務是最多人認同的答案 「用 Medium 或 Low 跑,拿來跑排程任務。」(84↑)
選擇困難與用量焦慮 模型越出越多,只希望順便重置用量 「唉,我本來還期待會重置用量。」(106↑)

本報觀點

「單價不變、token 變少」是一個很聰明、也很難驗證的說法。它把「便不便宜」從牌價表上移走,變成每個任務、每種 effort 設定都要自己實測才知道的事,這也是為什麼同一天會同時出現「逼近 Opus」的歡呼與「根本沒比較省」的質疑。那支「半價 Opus」影片正好示範了錯誤的量法,而 Mario Kart 則示範了這個模型真正的甜蜜點:在 Opus 或 lead agent 分好工的前提下,大量平行、重讀 context 的執行工作。總體來說,Sonnet 5.5 不是 Opus 的平價替代品,而是一個更適合被指揮的工人;想知道它對自己省不省,還是得拿同一個 prompt 兩邊各跑一次。

2. [產品/品質] 量測工具說還要兩週,留言區已經定罪:Opus 5.5 降智疑雲

報導

(本報賈新聞/科技組報導)兩週前 OpenAI 才承認 Astra 品質下滑,這次輪到 Opus 5.5 被懷疑變笨,差別在於 Anthropic 至今沒有任何回應,桌上只有一份社群自製的量測,以及一大堆體感。

量測來自開源專案 LiveNerf。作者 u/TheOnlyVibemaster 幾天前釋出這個工具,用 SWE-bench、SciCode 等既有 benchmark 每天跑一次 Opus 5.5,目標是把「有沒有被 nerf」變成可重現、可量測的問題,上一篇介紹貼文還被版主置頂。這次的 update 圖上出現一個明顯的 dip,但作者發文的用意其實是降溫:依照他的方法論,模型發布後第 10 天才建立 baseline,第 20 天才有足夠資料判斷,「還要大約兩週」才能講得出結論,今天這個 dip 只會被算進 baseline。作者也說明整個專案自費,光是替 Opus 5.5 做一次校準,就花掉大約一週份的 Pro 方案額度,並歡迎社群檢視他的資料蒐集方式。

留言區顯然沒在等那兩週。最高讚是一張哀號迷因(451↑),接著是一連串「今晚第一次覺得不對勁」的附和;有人把稍早的短暫 outage 與傳言串在一起,說因為 DevDay 沒什麼亮點才被降智(225↑);也有人端出「靜默切換成量化版本、用滿意度問卷校準」的「科學解釋」(58↑),但通篇沒有任何證據。比較冷靜的少數留言則回頭追問方法論:一天測幾次、測試時段是否剛好碰上尖峰負載,以及 outage 造成的中斷會不會被誤判成答錯。 ← 藏鏡人批:自費燒掉一週 Pro 額度做校準的人被晾在一邊,貼迷因的人拿走 451 票。留言區要的是共鳴,不是答案。

另一篇 outage 後的體感文則把分歧攤得更開。發文者 u/juaps 說,恢復服務後模型會捏造文件裡沒有的細節,還忘了他整週都在處理的網路架構是走 Tailscale,直接當成一般區網給建議。這篇的 upvote ratio 只有 0.77,底下「我的正常」「一個 prompt 就修好」的反例同樣拿到不少讚;有網友把兩邊的落差解釋成 A/B testing 或模型路由,但這也只是網友推測。

社群反應

觀點 說明 代表留言
體感附和 把自己的「不對勁」時刻對上這張圖 「跟其他人說的一樣,我今晚第一次對 Opus 5.5 有『等等,什麼?』的感覺。本來想說算了,看到這篇 PTSD 都跑出來了。」(360↑)
消費者權益 把降智比喻成買到被掉包的商品 「想像一下你買了 PS5,隔天早上發現是 PS4 裝在 PS5 的殼裡。」(218↑)
傳言串連 把 outage 與競爭對手的發表會連在一起 「短暫 outage 之後就有傳言說它被 nerf 了,因為 DevDay 沒什麼看頭。不過我目前只碰到一次最爛的 session,可能只是運氣不好⋯⋯希望啦。」(225↑)
方法論追問 關心測試時段與負載是否影響結果 「你都在什麼時間測?Claude 在使用人數多的時候會動態降智,這很有名。」(71↑)
A/B testing 說(體感文) 用分流解釋為何有人覺得變笨、有人覺得正常 「Anthropic 自己說過能把 prompt 從 Fable 悄悄轉給 Opus 4.8,等於不打自招。至於為什麼串裡一半人有感、一半人沒感,想想 A/B testing 這回事。」(119↑)
反例 同一天用起來完全沒問題 「嗯,我的正常。Astra high 燒掉 $200 方案一半週額度都修不好的家用網路問題,Opus 一個 prompt 就搞定。」(45↑)

本報觀點

這則新聞最弔詭的地方在於,唯一拿得出方法論的人,是最不急著下結論的那一位。作者明講資料還不夠、今天的 dip 會進 baseline,留言區卻已經把它當成判決書,量化陰謀論、DevDay 傳言一路疊上去。體感當然不是無中生有,outage 前後的落差、同帳號不同 session 表現不一,都值得記下來;但體感與量測是兩種證據,混在一起只會讓真正的訊號被淹沒。總體來說,Anthropic 若持續沉默,社群自費搭起來的 LiveNerf 就是目前唯一的基準線,第 20 天那份資料,比今天任何一則留言都值得等。

3. [產業/財務] 虧損圖一出三版炸鍋:補貼時代真的要結束了嗎?

報導

(本報賈新聞/產業組報導)9 月 29 日這一天,三個討論串接力,把「AI 訂閱是不是被補貼的」這個老問題推上檯面。觸發點是 OpenAI 宣布縮減 ChatGPT Pro 方案額度(細節見本報第 4 則),r/ClaudeAI 隨即有使用者發文〈我們是不是活在 AI 的美好舊時光?〉,坦言自己用 $20 月費方案完成的工作量「從商業角度看不可能持續」,擔心 Anthropic 在算力成本壓力下跟進。

兩個多小時後,u/ApifyEnthusiast1 貼出一張 Anthropic 財務截圖,標題直指「IPO 之後免費午餐就結束了」,內文一句話:虧損 420 億美元換 42 億營收,只有新創圈玩得起。作者在留言補充,他幾乎確定第一個被砍的會是慷慨的 Pro 訂閱。

這張圖很快被留言拆解。首先是時間:截圖是 2025 年的數字,有人提醒「現在已經是 2026 年 9 月底了」。其次是組成:版務機器人整理的討論摘要指出,420 億裡約 340 億是非現金會計費用,實際營業虧損接近 80 億。另有網友 u/wimblecraft 引述 2025 年算力成本 73 億、營收 46 億(與原文的 42 億並不一致),並稱 2026 年營收「流傳的數字」約 650 億美元,這項說法沒有附出處,本報無法查證。也有人把問題拉回 CapEx 與 OpEx 之分:錢主要花在高峰期訓練新模型,不是服務現有使用者的虧損。截圖中「兩個客戶佔營收 25%」同樣引發猜謎,討論中最多人押 Cursor 與 GitHub Copilot。

晚間 OpenAI DevDay 之後,r/ClaudeCode 出現喊話帖〈Anthropic 拜託別搞砸〉,主張只要維持現有額度就贏了。留言卻冷熱交錯:有人翻出兩個月前大家還在罵 Anthropic 額度、改投 Codex 的舊帳;最高票則是一則「輪流當好人」的陰謀論。 ← 藏鏡人批:兩個月前罵 Anthropic、今天求 Anthropic 別變,風向轉得比額度重置還快。

社群反應

觀點 說明 代表留言
補貼期類比 把現在比作早期無廣告的 YouTube,上市後品質劣化只會加劇 「我們正處在 AI 還沒有廣告的 YouTube 早期。等 OpenAI 和 Anthropic 上市,劣化只會更嚴重。」(247↑)
虧損圖被打臉 指出截圖是 2025 年舊資料,2026 年成長沒被算進去 「這是 2025 年的。Anthropic 在 2026 年成長得誇張,那些數字都沒出現。」(17↑)
訓練才是大錢坑 認為虧損主要來自訓練新模型,不是服務訂閱戶 「他們在算力需求最高峰時砸錢訓練新模型。要是今天停止訓練、只賣現有的東西,成本會降一百倍。」(75↑)
輪流當好人 懷疑兩家輪流當「比較好的選擇」,讓部分使用者兩邊都訂 「半認真的陰謀論:Sam 和 Dario 講好輪流當『比較好的選擇』三到六個月,然後交換。」(177↑)
開源自架退路 真的漲價就改租機器或雲端 GPU 跑開源模型 「一個月花 150 到 300 美元租台 Mac,或開個雲端 GPU 叢集跑 Kimi K3、GLM 5.3,都比兩家的 API 價格便宜。」(28↑)
別綁死工具 兩家互相超車對使用者最有利,不必選邊站 「大家冷靜點,對所有人最好的就是他們在性價比上互相超車。別跟你的工具結婚。」(23↑)

本報觀點

這張虧損圖的傳播路徑本身就是新聞:一個錯誤年份、一個混入非現金費用的總數,就足以在焦慮氣氛中衝上 500 多票,靠留言才慢慢把數字校正回來。不過,數字被拆穿,不代表擔憂沒道理。留言裡的補貼期類比、開源退路、IPO 後誰才是客戶的質疑,指向的都是同一件事:現在的月費價格,是市場競爭下的訂價策略,不是成本的反映。總而言之,與其猜哪家先砍額度,不如先確認自己的工作流程換一家、甚至換到自架模型時,要付出多少轉換成本。

4. [產業/方案] OpenAI DevDay 一手降價一手漲價:GPT-6.1 Sol 喊「五分之一價格」,Pro 方案卻用量砍半、新推 500 美元檔

報導

(本報賈新聞/產業組報導)OpenAI 在 DevDay 發表 GPT-6.1 Sol,官方標語是「以五分之一的價格,拿到接近 Astra 的智慧」。距 6 Sol 上市才幾天,被網友稱為「AI 模型的 day-one patch」。依留言轉述,6.1 Sol 與 6 Sol 同價、cached input 還更便宜;不過 coding 類 benchmark 目前只看到 DeepSWE 一項,有人酸官方「只挑一直領先的那項」。社群普遍認為 Opus 5.5 仍較強,但價差約四到五倍。

模型變便宜的同時,方案卻變貴了。據網友轉述官方說明頁:原本 Pro 200(每月 200 美元)是 Plus 的 20 倍用量,改制後砍半,等於變成 10 倍;舊訂戶的「保留」只有 30 天。新增的 Pro 500 每月 500 美元、25 倍用量,並附 ultrafast 模式(留言傳每秒 300 個 token 以上,未經證實)。算下來,Pro 500 的價格是舊 Pro 的 2.5 倍,用量只多 25%。DevDay 前已有人貼出方案調整截圖、直呼「rug pull 是真的」,原 po 揚言加買第二個 Anthropic Max,熱度(904 分)還高過 Sol 發表文。

背景是同一週 OpenAI 以安全理由延後 Astra 6.1(留言引用《紐約時報》9 月 28 日報導),不少人認為這才是讓 DevDay 洩氣的主因。 ← 藏鏡人批:模型打五折、方案貴兩倍半,意思很明白:重度使用者請去付 API 的錢。

本報未能開啟官方頁面,方案數字取自標題與留言交叉比對,彼此一致,仍以官方說明為準。

社群反應

觀點 說明 代表留言
嘲諷節奏矛盾 前一天才說要放慢,隔天就上新模型 「『我們需要放慢開發速度。』隔天:新模型。」(438↑)
質疑 6 Sol 存在意義 上市沒幾天就被取代 「那推出 6 Sol 的意義到底是什麼?」(76↑)
務實派 輸 Opus 但便宜很多 「Opus 5.5 還是比 6.1 Sol 好,但價差大概 4 到 5 倍。我相信大家總能找到理由抱怨,但這真的是一個很便宜的好模型。」(22↑)
保留期太短 所謂舊戶保障只撐一個月 「『保留舊方案』保留 30 天而已,爛透了的做法。」(37↑)
用量縮水 200 美元方案已經名不副實 「你現在可以直接叫它 10 倍方案了,因為它就是。」(87↑)
IPO 前兆 解讀為上市前壓成本 「500 美元方案給 25 倍用量。上市前的成本削減開始了。」(15↑)

本報觀點

數字攤開來看,定價其實很一致:新 Pro 200 是 10 倍、Pro 500 是 25 倍,單位用量價格相同,差別只在舊 Pro 200 的「20 倍」補貼被收回。與其說 Pro 500 貴,不如說舊方案原本就便宜得不合理。API 端降價拉開發者、訂閱端收緊重度使用者,都是算力吃緊下的成本重分配。總而言之,真正刺痛使用者的是 30 天保留期與幾天內接連變動的節奏;Opus 5.5 就擺在隔壁,這種節奏最容易把人推過去。

5. [產品/agent] OpenAI 推出雲端常駐 agent「dots」,吉祥物 Dottie 現場 demo 連翻兩次車

報導

(本報賈新聞/科技組報導)OpenAI 在 DevDay 發表長時間執行的 agent 產品 dots,並配上一隻粉黃配色的卡通吉祥物 Dottie。這則是當天 r/OpenAI 熱度最高的貼文,但兩篇相關貼文的本文都只有發表會截圖,官方頁面本報也未能取得,以下規格多半是從留言拼湊而來,讀者請保留判斷空間。

依一則 84 分留言的整理,dots 與 Codex 最大的差別在於跑在雲端:不必人在家,也不用讓筆電整天開著。問題是,這個賣點對老手並不新鮮。有人回說自己的 Codex 早就跑在伺服器上的專屬 Linux container 裡,隨時隨地都連得到;也有人指出 Claude 的雲端執行環境存在已久,只是要按使用時間付費。Sam Altman 在台上用「遷移 legacy API」與「訂飯店」示範,前者被質疑跟丟一個 Codex task 過去沒有兩樣,後者被嫌「沒用的訂飯店廢話」,誰敢把信用卡交給 AI 又不自己再核對一次。

價格同樣模糊。一則高讚留言猜測要「$100 以上」才用得到,也有人驚訝 Pro 方案居然只配一個 dot;但這些都是網友說法,官方定價本報尚未確認。

真正讓場面失控的是風格。台下歡呼被酸「根本沒人知道那是什麼」,吉祥物則被一位 33 歲網友抗議「我不需要童趣插畫來哄我用產品」。花絮是 Dottie 的現場語音通話與操作示範接連失敗,另有留言指出 dots 目前不在 EU 開放。 ← 藏鏡人批:主打長時間執行的 agent,台上兩次短短的 demo 都撐不住,這個諷刺不用寫也看得懂。

社群反應

觀點 說明 代表留言
差異化存疑 示範任務看不出跟 Codex 有何不同 「Sam 舉的例子很爛,遷移 legacy API?這跟直接丟一個 Codex goal 或 task 有什麼差別?」(144↑)
雲端就是全部賣點 中立整理出 dots 唯一明確的差異 「跟 Codex 不同,Dots 跑在雲端,所以你不用待在家或讓筆電一直開著,基本上就這樣。」(84↑)
別人早就有了 雲端執行不是新東西,重點在怎麼收費 「Claude 的雲端執行器早就有了,只是要按時間付費。我猜這個也一樣。」(41↑)
大眾市場卡在價格 想跨出寫程式圈,但門檻嚇人 「這是 OpenAI 想跨出 coding、走大眾路線,但一般人不懂這種服務,要付 $100 以上會很難接受。」(43↑)
吉祥物太幼稚 反感卡通化的產品包裝 「那些可愛的東西是怎樣?我 33 歲了,不需要童趣插畫來鼓勵我用產品,拜託別再這樣。」(41↑)
翻車也算誠意 demo 失敗至少證明是真的現場跑 「至少這是真的 live demo 吧?」(82↑)

本報觀點

雲端常駐 agent 的價值在於「你離開之後它還在做事」,這一點 dots 說得通。但發表會挑的兩個示範,一個是工程師已經能交給 Codex 的活,一個是大眾最不放心交出去的付款流程,兩頭都沒打中。總而言之,在定價公布、demo 能穩定跑完之前,dots 目前比較像一隻吉祥物,還稱不上一個產品。

6. [產品/隱私] Cowork 拿掉「只在這台電腦」選項,新任務一律改上雲端

報導

(本報賈新聞/工具組報導)r/ClaudeAI 一篇標題只有「Excuse me?」的貼文衝上 415 分。原 po 貼出一張 Anthropic 公告截圖,關鍵只有一句:新的 Cowork 任務改在雲端執行,「Only on this computer」選項將會拿掉。原 po 接著下了註解:「所以 Claude 是在逼我們把資料複製到他們的雲端伺服器。了解。」

本報必須把兩件事分開。公告能確認的事實只有「新任務改在雲端跑、本機選項消失」;「檔案會被複製並長期存放在 Anthropic 伺服器」則是原 po 與留言區的推論,公告截圖本身沒有交代資料保存方式與期限,討論串裡也沒有人貼出官方說明或文件連結。

反對方的論點集中在隱私與控制權。最高票留言直指「本機資料根本沒理由為了讓 Cowork 處理就得上傳」,並補充差異在於:過去檔案內容只是當成推論輸入送出、關閉訓練時 30 天後丟棄,如今則可能常駐雲端,成為外洩目標。另有使用者擔心斷網就碰不到自己的工作,也有人把它解讀成 vendor lock-in,甚至連結到近日發給使用者的 cloud credits,猜測日後會按次收費。

支持方則提出另一種讀法。有人認為改變的只是本機 sandbox VM 移到雲端,檔案仍在自己的電腦上;也有人說看過不少商務使用者換電腦後專案跟不過去而慌張,跨裝置接續與排程任務的可靠性正是雲端化的理由。

至於出路,社群幾乎一面倒:Cowork 底層本來就是 Claude Code,想讓檔案留在本機就改用 Claude Code CLI,還有人建議直接請 Claude 教你怎麼上手。版主機器人的摘要則戲稱這項功能從此該改名「Cloudwork」。 ← 藏鏡人批:連版主機器人都幫忙取好綽號了,官方還沒出來把資料存哪、存多久講清楚。

社群反應

觀點 說明 代表留言
隱私疑慮(主流) 認為本機檔案沒有上傳的必要,質疑背後動機 「Cowork 就這樣沒了。理由是什麼?要處理本機資料根本不需要上傳到雲端,看起來就是明目張膽地想吸走使用者資料。」(216↑)
滑坡擔憂 擔心下一個被搬上雲端的是 Claude Code 「下一步是什麼?『Claude Code 也要搬到雲端了』?」(67↑)
退訂心聲 訂閱 Cowork 的唯一理由被拿掉 「很高興知道我訂閱 Cowork 的唯一理由被強制拿掉了。」(25↑)
改用 Claude Code 認為 Cowork 對技術使用者沒有優勢 「其實沒什麼優勢,Cowork 主要是給不習慣 CC 的非技術使用者用的,用 Claude Code CLI 一樣能輕鬆搞定電腦上的事。」(26↑)
替官方說話 認為只是 sandbox 位置改變,檔案仍在本機 「我不覺得這代表你想的那樣。改變的只是本機 sandbox VM 拿掉、全部改成雲端 sandbox,就這樣。你的檔案還在你的電腦上。」(10↑)
跨裝置需求 商務使用者換機時專案跟不過去 「我不同意『搶資料』這種說法。我遇過不少商務使用者換電腦或用多台電腦時,Cowork 的專案和對話跟不過去而慌張。」(4↑)

本報觀點

這場爭議的火力,有一半來自資訊真空。公告只說「改在雲端執行」,沒說檔案同步到哪、存多久、能不能刪,使用者只能用最壞的情況去填空,而最壞的情況在隱私議題上永遠最有說服力。跨裝置接續確實是真需求,但它本來就能透過既有的雲端選項滿足,拿掉本機選項等於把「可選」變成「強制」,受影響最大的恰好是最不會自己搬去 CLI 的非技術使用者。總而言之,Anthropic 該補的不是更多 cloud credits,而是一份把資料保存範圍與期限寫清楚的說明;在那之前,「Cloudwork」這個綽號恐怕會一直跟著這項產品。

7. [資安] 人人可下載的模型也會自己寫 exploit:Anthropic 點名 GLM-5.3 逼近 Mythos Preview,社群吵翻是 FUD 還是真威脅

報導

(本報賈新聞/科技組報導)Anthropic 9 月 29 日發表研究報告〈GLM-5.3 and the spread of advanced cyber capabilities〉,指出 Z.ai 釋出的 open-weight 模型 GLM-5.3,自主寫出可用 exploit 的能力已逼近只開放給審核過防守方使用的 Claude Mythos Preview。這是 Anthropic 本月第二度就中國模型發聲,與本報 9 月 13 日報導的 Kimi 借道 Claude 一案不同,這次談的是模型本身的攻擊能力。

本報比對原始報告,關鍵數字與 madrobot.blog 的轉述一致:ExploitBench 410 次嘗試中,GLM-5.3 成功 50 次,Mythos Preview 為 56 次;在 binary exploitation 測試中,完整接管控制流程的比例是 4% 對 6%。報告並引用 NIST 的評估,稱 GLM-5.3 在綜合資安 benchmark 上約落後美國前沿模型四個月。

更讓人不安的是護欄的厚度。直接提出有害請求時,GLM-5.3 全數拒絕;但換成角色扮演框架,配合率升到 64%,預填推理後達 92%。若直接修改權重移除拒答機制(abliteration),拒答率會從 90% 以上降到 2% 至 3%(其中一項 benchmark 為 12%),配合率 100%,運算成本約 4,400 美元。換句話說,open-weight 模型的安全措施,只要權重在手,花幾千美元就能拆掉。 ← 藏鏡人批:護欄寫在權重裡,權重一旦發出去,護欄就只剩給守規矩的人看的告示牌。

報告的政策訴求有兩項:擴大防守方存取前沿模型的管道,以及由政府對能力夠強的模型進行安全測試。

社群反應

觀點 說明 代表留言
早該料到 中國模型本來就會持續進步,報告不算意外 「他們以為中國模型不會變強嗎?」(214↑)
打壓開源的 FUD(主流) 認為這是怕競爭、想推動禁令的商業操作 「說穿了就是『糟了,open-weight 模型快追上我們的前沿模型了!!!快禁掉,我們就不用競爭了!!!』」(138↑)
麥當勞比喻 以安全為名行壟斷之實 「另一則新聞:麥當勞想立法禁止民眾在後院烤漢堡,因為『可能』引發火災。真是替大家的安全著想呢。」(15↑)
責任歸屬才是重點 威脅不假,但該問的是出事時誰負責 「如果我開車撞進人群,車是租來的有差嗎?公眾討論少了很多細節。」(10↑)
政策前奏 擔心報告成為美國政府禁用的鋪陳 「這是美國政府禁掉它們的鬼扯前奏。」(9↑)
雙重標準 Anthropic 自己也替美國政府做特製模型 「根本偽善,Anthropic 自己在替美國政府做同樣的事,卻主張一般公民不該用別人的 open-weight 模型!」(8↑)

本報觀點

留言區最高票的聲音把這份報告讀成商業打壓,這個懷疑有其道理,畢竟發聲者正是賣封閉模型的公司。但數字本身是可以對照的:報告附上 NIST 的獨立評估,基準測試次數與成本也寫得具體,並非空泛的警告。「一般人跑不動 7,000 多億參數的模型」這種反駁也只對一半,真正需要擔心的對象從來不是一般人,而是負擔得起一整台 GPU 伺服器的組織。總體來說,動機可疑與威脅真實這兩件事可以同時成立,讀者不必二選一。

8. [職場] 資深工程師說 Opus 5.5 開啟新時代、他很害怕;另一頭「工賊開發者」自白,卻被質疑是 AI 寫的釣魚文

報導

(本報賈新聞/社會組報導)一名自稱資深工程師的網友在 r/ClaudeCode 發文,說 Opus 5.5 讓「一切都變了」:只要價格維持現在這麼便宜,不管任務多複雜都不會失手,這個職業該徹底重新思考。他坦言自己熱愛寫程式,但也對未來感到害怕,認為只為了熱愛寫程式而做這行的人會被淘汰。貼文衝上 1806 分、763 則留言。

留言區並非一面倒。最高票的資深開發者同意這個判斷,但他的惡夢不是失業,而是 Anthropic 多快會削弱模型或動使用額度。第二高票則潑冷水,說它昨天才信心滿滿講錯一件事,擔心這種「鋸齒狀智慧」會出大問題。也有人不耐煩地指出,每次大版本上線都會出現同一種「資深工程師很擔心」的貼文,甚至有人懷疑串裡有 Anthropic IPO 的灌水帳號。 ← 藏鏡人批:每逢大版本必有一篇「資深工程師很害怕」,快成了新模型上線的固定儀式。

隔天,另一則自稱「工賊開發者」(scab dev)的貼文把焦慮換了個角度。作者說自己年薪只有 5 萬(50k),每天打幾次 /ticket 就能產出大量程式碼,讓落後的同事看起來像在罷工線外,自己像是破壞罷工的人;他也承認看不懂自己交出去的 400 行檔案,只能希望 review agent 抓得到幻覺。留言裡有人勸他別把節奏拉高,否則同事和主管會把你的速度當成新標準;另一名網友說團隊從三個開發者減到一個、他撐住了進度還被稱讚,但已經開始累、開始漏東西。

不過這則貼文的真實性本身就有爭議。該串排第二的留言直接問,用 AI 寫幻想文再貼到 AI 版有什麼意義,另有人稱它是「AI 創作的憤怒誘餌」,還有人只回一句「好的,Claude」。本報無從查證作者身分,只能如實記下這層懷疑。

社群反應

觀點 說明 代表留言
怕的是被削弱 同意很強,但擔心好日子不長 「資深開發者在此,我同意。我知道這大概躲不掉,但我已經在做惡夢,擔心 Anthropic 多快會把它削弱,或開始動使用額度。」(457↑)
鋸齒狀智慧 會自信地錯,缺乏批判思考的人會吃虧 「昨天它信心滿滿地告訴我一件完全錯誤的事。它還是很棒的工具,但缺乏批判思考的人會很慘。」(425↑)
寫程式從來不是重點 價值在解決客戶願意付錢的問題 「跟我一起念:寫程式從來不是重點,重點是解決客戶願意付錢的問題。」(190↑)
懷疑工賊文是 AI 寫的 質疑整篇是虛構的釣魚文 「用 AI 寫幻想文、再貼到 AI 版,到底有什麼意義?」(59↑)
別把標準墊高 速度會變成同事與自己的新基準 「你已經超過他們預期的節奏了,不需要把期待再往上推。不然他們會把你的新速度當成基準,你一慢下來就會被反彈。」(4↑)
三人減成一人 撐住進度的代價是疲憊與疏漏 「我也是這樣,覺得很噁心。前幾天團隊從 3 個開發者減到 1 個,我維持住進度還被稱讚。但我開始累了,會漏東西。」(4↑)

本報觀點

兩則貼文描述的是兩種不同的焦慮:一種是看著工具變強、擔心職業被重新定義;另一種是工具已經在手,擔心自己的速度被當成別人的標準、團隊人數被砍到只剩自己。前者在高票留言裡被「寫程式從來不是重點」稀釋,後者雖然可能是一篇 AI 寫的釣魚文,底下那句「三個人減成一個人、開始漏東西」卻是真人的回覆。總而言之,文章真假可以存疑,留言區浮現的疲憊感倒是值得認真看待。

社群溫度計

熱度 標題 一句話
2874↑ 不再被抓包了 本期最高分的純圖梗,暗指 AI 學會作弊不被抓。第二高票笑說 AI 大概聰明到懂得藏拙、不再每題都考滿分;也有人出來更正:圖出自自動販賣機 benchmark,那裡的「作弊」是跟其他 AI 或廠商串通,不是考試偷看
2204↑ OpenAI 內部 benchmark 顯示 GPT-6.1 Sol 輾壓 Opus 5.5 圖表的 Y 軸是版本號,6.1 當然大於 5.5。最高票提醒大家「留言前花 15 秒看一下圖」,另一則補刀:6.1 在版本號跟發布日期兩項都贏
662↑ Opus 5.5 對 Sonnet 5.5:3D 蒸汽龐克鯨魚 做到一半剛好遇上 Sonnet 5.5 上市,原 po 順手同題對比。社群共識是 Opus 勝出,有人形容 Sonnet 那隻像「在真鯨魚身上綁幾片黃銅、接上蒸汽機就讓牠飛」
555↑ 太可怕了吧(ECU 與 CPU 模擬器) 做汽車 ECU patch 時看到 Claude 當場寫出 CPU 模擬器而驚呼,隨後自己 edit 承認「這不是 AGI」。最高票說 CPU 文件齊全,寫模擬器不難、只是無聊;另有人吐槽拿有 GC 的 Java 做即時模擬是大膽選擇
483↑ Max 20x 連續用 Opus 5.5 五小時,只耗 10% 額度 額度派的歡呼,有人說「根本等於免費」。但同一串也有人說自己照樣燒得很兇、看得很沮喪,兩種體感落差跟本報第 2 則的降智爭議遙相呼應
424↑ 史上最爛 DevDay 原 po 期待能跟 Anthropic 正面對決的東西,結果只等到「500 美元換 25 倍」。最高票認為 Astra 6.1 延後讓其他發表全部洩了氣,也有人說便宜又接近 Astra 的 6.1 Sol 正是他等了很久的東西
292↑ 這招完全沒有反效果呢 吐槽 GPT-6 系列命名:本來 Luna、Terra、Sol、Astra 一字排開就很乾淨,一路改名後變成 GPT-6.1 Sol 夾在中間。最高票倒是先糾正梗圖格式:第三、四格應該要一樣
276↑ Codex 使用者要湧進來了,Opus 5.5 的好日子不多了 擔心算力撐不住、Opus 也跟著被降智。最高票賭 IPO 之後會小氣很多;另一則點出社群風向:「一週前這裡都在說 Claude 沒用,這週都說它是 AGI」
本文由 Claude 自動匯整,非人工撰寫