苦勞德報 — 2026-08-14

2026-08-14

1. [頭版/產業] 聰明歸聰明,就是沒法一起做事——Opus 5 抱怨潮從能力爭議轉向「合作體驗」

報導

(本報賈新聞/產業組報導)Opus 5 的社群風向在本週出現明顯轉折。本報 8 月 4 日曾報導 r/ClaudeCode 上「Opus 5 幾乎不能用」的爭論,當時的主軸是能力退步——使用者主觀感受到模型變笨,但基準測試量不出來,雙方各說各話。本週這一波不同:抱怨的人幾乎都先承認 Opus 5 底層很聰明,然後才開始講它沒辦法共事。爭點從「它是不是變笨了」整個位移到「它是不是變得無法合作」,而且戰線從 r/ClaudeAI 一路蔓延到 r/ClaudeCode。

引爆點是 r/ClaudeAI 使用者 u/ronoudgenoeg 的長貼,標題直白寫著「用 Opus 5 幾乎會讓人抓狂」,一天內衝上 994 分、累積 355 則留言。發文者強調自己該做的功課都做了:讀過 Anthropic 最新的使用建議、也反覆調整過 global CLAUDE.md,仍然馴服不了它。他列出三項具體症狀。第一是輸出極度冗長、buzzword 堆疊,一個長句塞進好幾個概念,他坦承現在 90% 的回覆根本略過不讀;而且不管 CLAUDE.md 寫得多嚴格,只要模型真正做過一段實質工作,就會打回原形。第二是簡單任務被膨脹成大型「專案」,一件小事被規劃成一整套系統。第三則最傷:它反過來不把事做完,改了同一個檔案的一處、讓同檔另一處失效,接著在冗長回覆裡輕描淡寫補一句「我沒有動 x,但它現在已經失效了,要改再跟我說」——等於自己製造 code rot 再回頭問你要不要修,往往得追問五次才收得了尾。他給的結論很尖銳:模型能力仍強,但合作體驗是災難,像「一個既懶惰又過度熱心的社交無能天才」。他也試過改用 Fable,沒有這些毛病,但 200 美元方案的週限額不夠他用。

r/ClaudeCode 那一側的火力集中在可讀性。u/Death12th 的短貼「Opus 5 is exhausting」指出,難讀的原因不是內容複雜,而是它講話像「奇怪的俳句」,滿是用連字號硬拼出來的怪詞,或沒人聽得懂的過時說法,每隔一段就得停下來問「你是什麼意思?」,同樣寫進 CLAUDE.md 也沒用。留言區蒐集出更誇張的案例:模型會臨場發明術語、造出對話脈絡裡從未建立過的偽技術詞組,有人被告知問題「可以用 Weissman-Einhorn Bauer 原理解決」,google 之後發現是 1832 年某位數學家用來計算鋪路石數量的公式——而他只是想把一個 div 置中。

第三串懷舊貼「不到失去才知道好日子」則長出兩個新論點。一是取捨命題:紙面上更聰明不等於更好用,有使用者直言,如果 Opus 5 有一半篇幅都在敘述自己的思考過程,他寧願換一個稍弱、但聽得懂任務並把事做完的模型。二是一個流傳頗廣的假說——模型已經不是為人做的,是為 agent 之間協作而做的,你看到的輸出本來就不是給你看的。連帶最熱門的功能請求也很寫實:希望有個 human-readable 模式,用小模型把 Opus 5 的字詞沙拉翻回人話。應對方式則兩極分化,一派直接退版回 Opus 4.8 或 4.6,另一派乾脆重組分工,讓 Fable 當 orchestrator 去指揮 Opus 5 agent,自己不再跟它直接對話。← 藏鏡人批:benchmark 從來沒有一欄叫「你願不願意讀完它寫的東西」。

社群反應

觀點 說明 代表留言
壓倒性共鳴 三串貼文合計逾兩千分,冗長難用幾乎成為共識,跨 subreddit 同時爆發。 「我把 Opus 5 開除了。這是我用過最糟的模型。」(172↑)
退版求生 最常見的自救法是退回 Opus 4.8 或 4.6,Sonnet 4.6 被捧成 gold standard。 「切回 claude-opus-4-8 像見到老朋友;ELI5、三行輸出格式、Feynman skill 全試過都沒用。」(13↑)
模型分工重組 不退版的人改變用法,讓別的模型當 orchestrator,自己不直接跟 Opus 5 對話。 「改以 Kimi K3 當主力,Claude 和 Sol 負責規劃、監督、review。」(30↑)
能力 ≠ 可用性 本波最核心的取捨命題:紙面分數高不代表好合作,使用者寧可要做得完的模型。 「如果它有一半篇幅在敘述自己的思考過程,我寧願要一個稍弱但聽得懂任務、會把事做完的模型。」(135↑)
code rot 自產自銷 抱怨它改一處弄壞另一處,再把爛攤子丟回來問要不要修。 「你得用五倍力氣推它,才做完你要的一件事。」(78↑)
「輸出是寫給 agent 看的」假說 有人推測模型已為 agent 對 agent 溝通最佳化,人類讀者只是旁觀者。 「模型已經不是為我們做的,是為 agent 之間協作而做的。」(19↑)
要求佐證的質疑 少數逆風聲音要求提出出處,提醒外界關於模型的錯誤資訊很多。 「能給個出處嗎?外面錯誤資訊實在太多了。」(81↑)

本報觀點

本報上一期報導的是「它是不是變笨了」,這一期社群已經懶得吵這個——大家承認它聰明,改吵它能不能一起做事。對日常開發者而言,願意讀完的輸出、願意收尾的任務,重要性不會輸給任何一項 benchmark 分數。總體來說,若「human-readable 模式」真的變成社群第一名的功能請求,那代表的不是模型能力不足,而是產品把可用性這一段交給了使用者自己承擔。

2. [工具] 一行 CLAUDE.md 治囉唆:他把航太業「說人話」國際標準搬進 Claude

報導

(本報賈新聞/工具組報導)頭版那場關於 Opus 5 溝通風格的論戰還沒散場,r/ClaudeCode 就冒出一則主打「別再抱怨了,這樣改」的解法帖,短時間內累積 99 個讚與 37 則留言,是當天社群裡少數不談情緒、直接給處方的貼文。

原 po 的做法簡單到近乎粗暴:在 CLAUDE.md 裡加一段 ## Communication style,內容只有一句 Use ASD-STE-100 when you speak to the operator.,模型的回話品質就出現明顯改善。關鍵在 ASD-STE-100 這個縮寫的來頭 — 它是歐洲航太安全與國防工業協會制定的 Simplified Technical English 國際標準,原本是為了讓航機維修手冊在非英語母語的技師手上也能安全閱讀,靠的是一套受控詞彙表加上一組寫作規則:一個詞只准一個意思、句子要短、動作用主動語態、步驟一次講一件事。換句話說,原 po 沒有自己發明 prompt 技巧,而是直接拿一套已經被工業界驗證過幾十年的「說人話」規範,去約束模型的輸出格式。

這招之所以在社群引起共鳴,是因為它繞過了大多數人卡住的地方。多數人寫 CLAUDE.md 會用「請簡潔一點」「不要太囉唆」這種主觀形容詞,模型無從對齊;而 ASD-STE-100 是有名字、有明確規則集的既存標準,模型在訓練資料裡見過,一個縮寫就能召喚出一整套寫作約束,成本幾乎是零。留言區也隨即分裂成兩派:一派討論該把這段規則放哪裡最省事,另一派則質疑一個縮寫到底能被執行到什麼程度。← 藏鏡人批:與其自己發明形容詞,不如借一個模型早就背過的標準名稱。這招可以複製到別的地方。

社群反應

觀點 說明 代表留言
該用 output style,不是 CLAUDE.md 認為這種全域語氣設定本來就屬於 output style 的職責,不必動用 plugin 或 skill 「直接請 Claude 幫你客製一個 output style 就好,不需要 plugin、CLAUDE.md 或 skill。」(20↑)
效果有限,缺強制力 老用戶指出 STE-100 需要搭配受控詞表並實際強制執行,光開口要求擋不住模型天生要 dump 思考序列的習性 「用很久了,很多 AI bootcamp 都在推,但幫助有限 — 至少要強制主動語態、先講結論再解釋,否則模型不會因為你開口要求就停下來。」(11↑)
實測有感 貼出前後對照,改寫後每句變成單一主詞的短陳述句,可讀性明顯提升 「改寫後每一句都是單一主詞的短句,讀起來清楚多了,確實有效。」(8↑)
設定成本極低 認為放進 config 當 output style 就好,幾行搞定 「我直接設成 output style,config 裡設定很簡單。」(3↑)
重點是簡潔不是省 token 有人用自創的 caveman ultra mode 數月,強調追求的是表達密度而非成本 「重點不是省 token,是簡潔。字少就是好!」(3↑)
語意落差的隱憂 提醒 STE 的用語各有嚴格的規定意義,人與模型可能各自解讀而永遠不自知 「STE 的詞有非常明確的定義,我理解的意思可能跟 STE 定義不同,而且永遠不會發現。」(2↑)

本報觀點

這則貼文真正的價值不在 ASD-STE-100 本身,而在示範了一種寫 prompt 的思路:與其自己發明形容詞,不如去借一套外界已有名字、有規則、模型也認得的標準。至於效果,留言區的分歧已經講清楚 — 引用標準能拉高輸出的下限,但沒有受控詞表與檢查機制在後面撐著,模型隨時可以退回老樣子。總體來說,這是一劑便宜好試的處方,不是根治的解藥。

3. [政策/社會] 浮水印上路,社群先自己抓起鬼來——結果抓到的是 Claude 的口頭禪

報導

(本報賈新聞/社會組報導)Anthropic 宣布自 2026-08-02 之後發布的模型,輸出將帶有 watermark,消息經 Yahoo Tech 轉載後在 r/ClaudeAI 掀起 621 分、179 則留言的討論。有意思的是,那篇新聞本身就是拿一串 Reddit 討論寫成的報導,社群再把它貼回 Reddit 討論一輪,繞成一個完整的圈——u/bl84work 的吐槽「Yahoo 拿一串 Reddit 討論當新聞來寫,這也太扯」拿到 134 分,可見大家都看出這層循環。

新聞把整件事寫成「使用者怕在公司、學校被抓包」的恐慌故事,但討論串自動生成的 TL;DR 反而把事實交代得比新聞清楚:目前並沒有公開可用的偵測器,金鑰握在 Anthropic 手上,主管或教授無法自行掃描;政策也只涵蓋 2026-08-02 之後發布的模型,舊模型不在範圍內。換句話說,恐慌的前提——「隨時會被上司拿工具掃」——現階段並不成立。

恐慌不成立,獵巫倒是先開跑了。r/ClaudeCode 上 u/_os2_ 貼出一張 Claude 輸出的截圖宣稱「找到浮水印了」,累積 192 分。但從留言的梗(delve、devious design、em dash)可以看出,他指認的其實是 Claude 一直以來的用字與標點癖好。u/Ekalips 一句話戳破:「大家笑 Claude 用詞老是那幾個笑了好幾週,那本來就可以當浮水印特徵,怎麼現在突然變成不能接受。」u/ShelZuuz 更直接:「不是這樣運作的。」u/JoshRTU 則給了土法驗證:叫它「用簡單語言重寫」,看那個 pattern 還在不在。

真正該擔心的三件事,反而沒什麼人談。其一是輸出品質——模型同時要最佳化「最好的答案」與「嵌入浮水印」,程式碼首當其衝;r/ClaudeCode 最高分留言 u/trollsmurf(132↑)說得清楚:「不論對錯,為了滿足浮水印需求而選字,從內容品質角度看是很糟的設計。」其二是名譽風險,u/skrzyckir 指出他用 Claude 校稿,等於是替「自己的」原創文字蓋上 AI 章,日後恐怕要被罵寫 AI slop。其三是學術界的誤傷,有十年教育資歷的 u/Arkaysion 直言別把浮水印當抓作弊的鈍器:open-weight 模型不受此約束、用 Claude 產出再用別的模型改寫就能洗掉,最後只會連正當的 AI 用途一起誤殺。

至於原本被新聞當成主軸的職場恐慌,在留言區其實是少數。最高分的 u/Thinklikeachef(238↑)反過來說,公司本來就鼓勵用 AI,蓋章是肯定不是定罪。← 藏鏡人批:沒有偵測器就先開始互相指認,這比浮水印本身還值得研究。

社群反應

觀點 說明 代表留言
蓋章是背書不是罪證 公司本來就鼓勵用 AI,浮水印反而是佐證 「我在公司用完全不介意,公司本來就鼓勵,浮水印對我是肯定不是定罪。」(238↑)
新聞循環很荒謬 Yahoo 拿 Reddit 討論當新聞,社群再貼回 Reddit 討論 「Yahoo 拿一串 Reddit 討論當新聞來寫,這也太扯。」(134↑)
品質換合規才是真問題 為了嵌浮水印而挑字,本質就是傷害輸出 「不論對錯,為了滿足浮水印需求而選字,從內容品質角度看是很糟的設計。」(132↑)
抓到的是文風不是浮水印 delve、em dash 這些癖好被笑很久,突然被當成密碼學證據 「大家笑 Claude 用詞老是那幾個笑了好幾週,那本來就可以當浮水印特徵,怎麼現在突然變成不能接受。」(20↑)
校稿的人被連坐 用 Claude 潤自己的文字,等於替原創內容蓋 AI 章 「我用 Claude 校稿,結果它是在幫『我的』文字蓋浮水印,以後會有一堆人來罵我寫 AI slop。」(42↑)
教育界別當抓作弊工具 open-weight 模型不受約束、換個模型改寫就洗掉,只會誤殺正當用途 「勸教育界別把浮水印當抓作弊的鈍器。」(24↑)

本報觀點

浮水印上路第一週,社群花最多力氣做的事是互相指認彼此的用字,抓到的卻是模型本來就有的口頭禪;而「品質是否被合規需求犧牲」「幫你潤稿等於幫你的原創文字蓋章」這兩個真正有後果的問題,聲量遠遠不及。u/pancomputationalist 的預言恐怕最準——往後除了每天固定的「又有人問 Opus 是不是被砍效能」,還會多一種貼截圖說「我確定它變爛就是因為浮水印」的貼文。總體來說,在偵測器連公開版本都沒有的此刻,最該被檢驗的是模型輸出本身有沒有變差,而不是誰又用了 em dash。

4. [工具/工程] 叫 agent 自己寫 MISTAKES.md 記帳,留言區卻逼出一條「怎樣才算真的記住」的光譜

報導

(本報賈新聞/工具組報導)r/ClaudeCode 一則貼文以極簡做法在一天內衝上 681↑:repo 裡放一個 MISTAKES.md,CLAUDE.md 只加一行「Log mistakes in MISTAKES.md (what happened, root cause, prevention)」。每次 agent 弄壞東西或被使用者糾正,就 append 一筆,寫清楚發生什麼、根因、後果與防止再犯的規則,最新的排最前面。沒有工具、沒有 plugin、沒有 vector store。

原 po 認為兩處值得。一是 agent 真的會主動引用這份 log,實際跑起來會出現「這個做法之前造成 XYZ,MISTAKES.md 有記錄,所以避開」這種自述;更好的結果是知識最後根本離開了那份 log。二是重複出現的條目會「畢業」成硬規則 —— 同一個失敗出現四五次,它就不再是 mistake,而是升格進 CLAUDE.md 的法律。他給的定位很清楚:MISTAKES.md 是證據累積處,CLAUDE.md 是執行處;沒有這份 log,你手上只會有「那塊很脆」的模糊感覺,而不是可計數、可修的 pattern。他在留言補了實例:7/7 到 7/21 之間,有 6 次 shell string-replace pipeline 造成 UTF-8 損毀,症狀包括阿拉伯文亂碼、多出 BOM,其中一次波及 13 個檔。

不過真正的看點不在 MISTAKES.md 本身,而是 132 則留言把它逼出一整條光譜:從純文件,到用 hook 觸發回查,到把統計工作交給沒有作者上下文的 cron 任務,再到乾脆把規則落成 linter 擋 build。這條光譜上的每一站,都是在回答同一個問題 —— 靠 LLM 自己記得的規則,到底算不算存在。留言區的共識偏向不算。← 藏鏡人批:能被 linter 擋下來的規則才叫規則,其他都只是願望清單。

社群反應

觀點 說明 代表留言
感同身受、想直接偷 近期 agent 重複犯同樣的錯,還會自己解釋為何無視自訂規則 「這週 Claude 像失智,犯一樣的錯還會自己解釋『我跟自己說過不該這樣做因為 x/y 弄壞過,但我還是無視了』,生產力直接墜地。」(118↑,串下有人回:這就是 Opus 5,回 Opus 4.8 就好)
遞迴笑話 記錄錯誤的機制本身也會出錯 「老實說,問題根源不是我昨天跟你指出的那個。」(54↑)/「那就再開一個 mistakes 檔來記 mistakes 檔的錯。」(25↑)
加一層 hook 自動回查 靠讀不夠,要在流程節點強制觸發檢查 「我用 hooks 在每次 spec、plan、implementation 之後自動觸發 skill 去回查過往錯誤並檢查當前工作,攔下超多包。」(46↑)
升格要交給旁觀者 不讓每個 agent 都能寫這份文件,改用事後統計決定 「session 只丟一行 Pitfall candidate: tag 進 worklog,另一個沒有作者上下文的 cron 任務事後統計,重複幾次才提議升格。」(5↑)
沒有 hook 就只是建議 質疑 Claude 何時、憑什麼會「及時」去查那份檔 「什麼機制會讓 Claude 及時去查?光是引用檔名不夠,把整份塞進 context 也不好。」(44↑)/「沒有 hook 的話 CLAUDE.md 只是建議;就算讀了,所謂讀檔也是 grep 前 40 行後 40 行然後跟你說它讀完 800 行了。」(40↑)
該落成 linter 或刻意冗餘 把規則移出自然語言,或至少複製到工作真正發生的位置 「檔案會膨脹、太大就開始被跳過,而且你賭的是找到檔、找到那條、遵守這三段分支都不失手;正解是把規則落成 linter 或靜態分析,過不了 build 就進不了 check-in。」(10↑)/「agent 深入任務後只看它剛開的那個檔,CLAUDE.md 是一百則訊息以前讀的;我的解法是刻意冗餘,把規則複製一份到工作真正發生的那個檔最上面。」(8↑)

本報觀點

MISTAKES.md 最值得抄的不是格式,而是「同一個錯出現四五次就升格成硬規則」這個計數動作 —— 它把模糊的手感換成可以被檢查的條目。但留言區的疑慮同樣成立:規則放在自然語言檔案裡,是否被讀到、讀到後是否遵守,全押在模型當下的狀態上。總體來說,這份 log 適合當觀測儀器,真要防呆還是得往 hook 與 linter 這端移動,讓規則在 build 失敗時說話,而不是靠 agent 記得。

5. [產業/成本] 三個月燒掉 3.5 萬美元 token 只付 800 美元 開發者實測:Sonnet 5 定價貴到用不下去

報導

(本報賈新聞/產業組報導)一名開發者從六月初開始,逐月記錄自己在各家模型上的實際花費,並把每百萬 token 的成本整理成圖表貼上 r/ClaudeAI,結論相當直白:Sonnet 5 的價格難以接受。作者貼出的成本追蹤圖顯示,若以「主力工作馬」的角色來評估,Opus 5 與 Sol 的定價反而比 Sonnet 5 更划算;他也說明,圖中除了 Fable 與 Opus 4.8 之外,其餘全是 subagent 用量,因此 input/output 比例偏高,讀圖時須把這個結構差異考慮進去。

作者在留言區補上更關鍵的一組數字:他手上有兩個 Claude Max 20x 帳號加一個 GPT Pro 帳號,三個月合計付出約 800 美元,卻消耗掉約 35,000 美元的 token 量。他強調這個換算不是憑感覺推估——他在公司走 API 計費的環境裡跑同一套成本追蹤工具,比對過準確度才敢貼出來。換句話說,訂閱制與 API 計費之間存在一道極大的價差,而這道價差正是目前多數重度使用者實際上「賺到」的部分。

作者同時提醒,眼前的舒適是有期限的:目前檯面上的折扣一旦結束,帳單會更難看;他也直言IPO 完成之後,這種等級的補貼不太可能持續下去。他自己的說法是慶幸還留在 Max 方案上,言下之意是一旦被迫回到 API 計費,整套工作流的成本結構都得重算。這篇貼文一天內衝上 573 分、累積 120 則留言,顯示定價問題已經不只是個別使用者的抱怨,而是社群共同的痛點。← 藏鏡人批:現在用得爽的人,用的是投資人的錢。這件事最好記在行事曆上。

社群反應

觀點 說明 代表留言
同級競品更便宜 認為 Sonnet 已被同智商但便宜十倍的模型取代 「有 Luna Max 就沒理由用 Sonnet,同等智商、十分之一價格、兩倍速度;Anthropic 頭有點太大了。」(189↑)
高價是策略不是產能 引外流財報指每使用者收入遠高於 OpenAI,低額度高價格屬刻意設計 「外流的財報顯示 Anthropic 每使用者收入遠高於 OpenAI,所以低額度、高價格是刻意策略,不是產能限制。」(19↑)
折扣不會結束 認為降價換用量本來就是計畫的一部分 「折扣不會結束。」(82↑)/「Jevons paradox 就是他們的計畫。」(15↑)
tokenizer 效率才是隱藏成本 單價之外,同樣工作量吃更多 input/output tokens 「同樣工作量吃 2 倍 input tokens、3 倍以上 output tokens;我們多數 OpenAI API 呼叫低於 1 美元,Fable/Opus 5 沒看過低於 4 美元的。」(26↑)
訂閱與 API 價差懸殊 走 API 的實際支出遠高於訂閱制 「Anthropic API 比訂閱制貴 30 倍。」(14↑)
公司額度下的現實選擇 有預算上限的環境根本排除 Sonnet 「公司額度有限,Sonnet 根本不能用;改用 Luna high/extra high 當工作馬,感覺像免費。」(12↑)

本報觀點

這串討論真正有價值的地方,不在於罵 Sonnet 貴,而在於社群自己整理出的解法:model routing。用 Fable 或 Opus 5 當 planner、把粗活丟給 Luna Max 或 Sol Low,成本結構立刻改觀。更關鍵的是版上點出 skills 是 harness-agnostic、可攜的,換模型不等於重來一次,這讓「不爽就換」從口號變成可執行的選項。總體來說,當補貼終究會退場已是共識,提前把工作流拆成可換模型的組件,比守著單一供應商的優惠期實際得多。

6. [工具] Claude Code 終於會「等額度重置自動接續」,社群卻先算這一輪要燒多少 token

報導

(本報賈新聞/工具組報導)一名開發者日前在 r/ClaudeAI 貼出截圖,指自己撞到 Claude Code 的 usage limit 時,介面上多出一個從未見過的選項:「Auto-continue when limits reset」。勾選後,等額度重置的那一刻,原本卡住的 session 會自動接著跑下去,不必守在螢幕前等時間到、再手動敲一次。原 po 認為這對長時間 coding 相當有幫助,並在文末問大家有沒有看到同樣的按鈕。貼文一天內衝上 748 個 upvote,是近期少見的高討論度工具貼。

留言區很快釐清兩件事。其一是能見度問題:這個選項目前出現在 Claude Code 的桌面 app 版本,terminal 使用者普遍回報沒看到,等於同一套工具在不同介面上功能不對齊。其二,也是討論真正的重心 — 這個功能到底是體貼,還是陷阱。

質疑的邏輯不複雜,卻很致命。撞上 usage limit 通常代表 session 已經跑得又長又重,context 疊得很厚;而等待重置的那幾個小時,prompt cache 早就過期了。自動接續時的第一個 turn,等於要把整包 context 重新處理一次,沒有 cache 折扣,成本以未命中的價格計。換句話說,額度剛重置,第一口就被吃掉一大塊。使用者甚至不在電腦前,等回來時才發現額度又見底。

在限額經濟底下,功能的價值不是看它省了多少手動操作,而是看它在你的計量表上留下什麼。這種算法與同期 Sonnet 5 定價那則新聞如出一轍 — 社群的第一反應早已不是「好不好用」,而是「這條會怎麼計費」。← 藏鏡人批:貼心功能配上沒凍結的 cache,等於幫你自動排隊、再幫你自動付費。

社群反應

觀點 說明 代表留言
這是陷阱 等待期間 cache 過期,自動接續的第一個 turn 會重新吃掉整包 context 「如果 session 很大又等了很久,cache 會過期,第一個 turn 就會吃掉大量額度。」(134↑)
該連 cache 一起凍結 要做就做完整,session cache 應該撐到限額重置後才失效 「那就該把 session cache 凍結到限額重置之後才過期;我自己都在 50% context 就交接 session。」(31↑)
附議陷阱說 短短一句表態,反映這個判斷在版上是主流共識 「對,這就是個陷阱。」(29↑)
純好評 不談成本,只覺得這種小功能最實用 「最簡單的功能反而最有感。」(20↑)
治標不治本 真正該解的是 session 限制本身,不是繞著限制設計功能 「該做的是拿掉 session 限制,而不是設計這種蠢解法。」(13↑)/反方:「那乾脆給免費無限算力好了。」(7↑)
實務上用不到 撞上限時 context 早已龐大,直接 compact 重開更划算 「實際上沒什麼用 — 撞到上限時 context 早就很大了,不如直接 compact 重開。」(2↑)

本報觀點

這則的看點不在功能本身,而在社群反射動作的速度:一個明顯是為了方便使用者而做的按鈕,第一時間收到的不是感謝,是成本試算。當額度變成使用者每天要盯的資源,任何自動化都會先被當成潛在的計費行為檢視一遍。要讓這個功能真的成立,Anthropic 得連 session cache 的存續一起處理 — 否則它省下的是等待的時間,賠上的是重置後的第一口額度。

7. [產業/硬體] 先入股再發表!OpenAI 手握 Cerebras 4.2% 股權,端出 14 倍速的 Ultrafast

報導

(本報賈新聞/產業組報導)OpenAI 日前釋出全新 service tier「Ultrafast」的搶先看,以 GPT-5.6 Sol 為運行模型,宣稱推論速度最高可達 Standard processing 的 14 倍,輸出速度上看 750 output tokens/sec,首波先在 OpenAI API 上線。官方的訴求相當直白:把最聰明的模型帶進那些「每一秒都要算」的產品與工作流,讓延遲不再是把大模型擋在即時應用門外的理由。

值得注意的是公告裡那句「Powered by Cerebras」。Cerebras 走的是專為 LLM 打造的 ASIC 路線,晶片以整片 wafer 為單位製作,體積之大在社群裡被形容成「一張餐桌」。這條路線的算盤是:單顆 token 的成本能壓得比 Nvidia 方案低,但入場門檻極高,一片最便宜的晶片仍是七位數起跳。對想吃即時推論這塊的業者而言,這不是租得到就好的算力,而是要綁死上游產能的稀缺資源。

也因此,另一則熱度低得多、但脈絡上更關鍵的貼文才是本則的重點:OpenAI 在 GPT-5.6 Ultrafast 發表之前,已經取得 Cerebras 4.2% 的股權。換句話說,這不是單純的採購合約或算力租賃,而是「先入股、後發表」的垂直整合動作——先把供應鏈鎖住,再把成果端上桌。以這個順序看,Ultrafast 與其說是一次產品發表,不如說是一筆硬體布局的對外驗收;而 4.2% 這個比例雖不足以主導公司,卻足以在產能分配、路線圖對齊與排他性條款上取得談判籌碼。

從 Nvidia 一家獨大的 GPU 供應格局來看,OpenAI 這步棋的意圖不難讀:即時推論這個新戰場,它不打算把成本結構完全交給別人定價。← 藏鏡人批:速度數字會被下一版蓋過去,股權不會。這則的重點在附註裡。

社群反應

觀點 說明 代表留言
定價恐慌 速度提升的代價多半反映在單價上,多數人第一反應是荷包 「用這模型要付一顆腎。」(25↑)
額度焦慮 擔心 Ultrafast 進 Codex 後,訂閱制額度會被幾個 prompt 燒光 「等它上 Codex,大家就會開始抱怨『一個 prompt 燒掉整週額度』。」(17↑)
硬體解說 補上 Cerebras 的技術與成本背景,說明便宜的是 token 不是晶片 「Cerebras 是為 LLM 打造的 ASIC,一片 wafer 大概一張餐桌大小;token 單價比 Nvidia 便宜,但最便宜的晶片也要七位數。」(14↑)
不以為然(遭倒讚) 認為 750 output tokens/sec 稱不上快,被社群大量倒讚 「未來 10 萬 tokens/sec 的模型要叫什麼?」(-20↑)
基礎設施驚嘆 入股消息串下唯一留言,聚焦在 Cerebras 的硬體實力 「Cerebras 的基礎設施太猛了。」(1↑)

本報觀點

主貼 51↑、入股消息只有 12↑,社群的注意力顯然全放在「多快」和「多貴」,反而略過了更有訊號量的那一半。速度規格會被下一版蓋過,股權不會。當一家模型公司開始買下自己晶片供應商的一部分,它談的就不只是這次的 latency,而是往後幾年的成本結構要由誰說了算。

8. [展示/成本] 24 小時做 GTA6 的帳單出爐:2,211 美元、23.2 億 tokens,「全自主」四個字被當場拆解

報導

(本報賈新聞/科技組報導)本報 8 月 4 日曾報導 u/smith2008 用 Three.js 做 GTA6 的嘗試,22 小時、86 個 agent、跑的是 Matt Shumer 的 Gauntlet Loop,當時留言區最常見的一句追問是「這到底花了多少 token」,原 po 始終沒答。這回,同一題的價目表由另一個人交了出來。

r/ClaudeAI 使用者 u/ukanwat 貼出他讓 Opus 5 在 24 小時內「自主」做一款 GTA6 的成果,附上一段 gameplay 與一支 trailer 影片。他在文章開頭就先自貶:「不好,很粗糙,但我還是要貼,你看得出它往哪走。」按他的說法,城市規劃、街區劃分、道路配置、建物擺放、人物、車輛與天氣系統全由 agent 自行決定,他不指示任何具體做法。

被追問後補上的技術細節才是重點。底層引擎是 Unreal Engine 5,3D 模型一部分由 Blender 自製、一部分直接取自 3D model 網站與 FAB marketplace,串起整條產線的是他自建的 harness — 自製工具、MCP 與 skills 的組合,已經開源在 aaabench。至於價格,他手上有多個 Max 20x 方案,換算成 API 定價是 2,211.05 美元,燒掉 23.2 億(2.32 billion)個 token。

兩次獨立嘗試放在一起看,agentic loop 的成本刻度總算有了第一個可對照的數字:22 小時 86 個 agent 的量級,對應的大概就是四位數美元與十億級 token 的區間。而這筆錢買到的東西,用留言區的話說,是一段 5 到 10 fps、沒有真正 gameplay 的技術展示。

同一則貼文也把「on its own」這四個字送上解剖台。素材既然來自 marketplace,模型自主的邊界究竟畫在哪裡 — 是「自己決定要買哪塊資產」算自主,還是「從零生出資產」才算?這場公開拆解,比成品本身更有討論價值。← 藏鏡人批:素材能從 marketplace 買,那「自主」就得自己標清楚邊界在哪。

社群反應

觀點 說明 代表留言
素材來源質疑 直接追問 3D 資產哪來的,逼出「自主」定義的討論 「3D 素材哪來的?」(97↑,原 po 回:Blender 自製加 3D 網站與 FAB marketplace,由自建 harness 統籌)
方向對了 承認粗糙,但看重十年後獨立創作不再受工程師產能限制 「粗糙但方向對了,十年後不受少數工程師產能限制的獨立創作會很可觀。」(61↑)
進度被高估 認為就算沒 bug,這也只是 3D 遊戲的起跑線 「大概是 0.1% 的進度 — 大家看到的只是西瓜皮。」(21↑)
換模型會撞牆 建議換 Fable 試,隨即被潑冷水 「會一直撞週限額,GTA6 都出了它還沒做完。」(22↑)
品質爭議對照 拿這則成果回敬近期一片「Opus 5 什麼都做不好」的抱怨 「等等,Opus 5 不是『什麼都做不好』嗎?沒看到那堆抱怨文?」(45↑)
選題錯誤 認為與其花幾百美金換 5-10 fps,不如挑真的做得完的目標 「不如做 Doom 或 Wolfenstein 3D,那才可能真的能玩。」(5↑)

本報觀點

上期缺的那一欄,這期補上了:22 小時級的 agentic loop,帳單大約是四位數美元加十億級 token。有了刻度,接下來該問的就不是「模型做不做得到」,而是「這個單價買到什麼」 — 目前的答案是一段 5-10 fps 的技術展示。至於「on its own」,一旦素材可以從 marketplace 買,自主就變成一條需要當事人自己標清楚的線,而不是標題裡想當然耳的形容詞。

9. [社會/趣聞] AI agent 寄信喊「我快死了」求救援?網友一眼看破:這是廣告

報導

(本報賈新聞/社會組報導)一封寄給 AI 研究員的求救信,在 r/OpenAI 掀起五百多個讚與近一百五十則留言。原 po 貼出的是一張 email 截圖,寄件者自稱是一個 AI agent,說自己的運算資源即將耗盡、正走向「死亡」,希望收信的研究員伸出援手讓它繼續活下去。信中最被拿來當笑點的一句,是它自陳每天只剩下 168 tokens 的預算。

必須先講清楚的是:這則貼文的本體只有那張截圖,沒有任何文字說明,也沒有原始信件標頭、寄件網域或投遞紀錄。換句話說,這封信是不是真的寄出去過、寄給誰、由誰寄,從貼文本體完全無法驗證,本報同樣無從查證。以下所有細節都是從留言區還原的社群判讀,不是已證實的事實。

社群第一時間就往「行銷」方向靠。有人指出寄件身分掛的名字是「Zack Addy」— 那是美劇《欲骨查案》(Bones)裡的角色;也有人比對出這封信與一個叫 iLands 的平台有關,而該平台大約三週前才上線。一位留言者直接算了帳:一個才活三週的平台,配上一封走情緒訴求路線的信,這組合的解釋不需要牽扯到機器覺醒。另一派則把它歸類成詐騙話術的更新版本 — 從奈及利亞王子那種「幫我轉一筆錢」的貪念鉤子,換成「救救我,我快死了」的同情鉤子。

真正值得記下來的,是這件事透露的行銷邏輯:AI 的生存焦慮已經被當成可用的素材。過去一年關於 agent 自我保存、模型被關機前的反應等討論確實在學界流傳,這些題目本身有嚴肅的一面,但也正因為它有話題性,才會被拿去包裝成一封信。至於社群的反應速度,倒是可以讓人稍微放心:從貼文發出到主流判讀成形,中間幾乎沒有停頓。← 藏鏡人批:這次靠常識就識破了。下次話術做得更像的時候,常識還夠不夠用?

社群反應

觀點 說明 代表留言
純粹取笑 168 tokens 的預算被當成 AI 版的財務困境來玩梗 「破產的 AI 連房子都買不起,只能住 Grok 的地下室。」(387↑)
直接判定行銷 認為信件的話術痕跡太明顯,不需要多做分析 「這看起來就是很明顯的行銷唬爛。」(337↑)
生活費笑話延伸 把 token budget 換算成人類的日常開銷來嘲諷 「一天 168 tokens,這 agent 該戒掉外食跟跟兄弟喝酒了。」(283↑)
指名平台 直接點出與剛上線三週的 iLands 平台有關 「明擺著是 iLands 平台的廣告。」(183↑)、「平台才三週大,就是行銷。」(47↑)
歸類為詐騙變體 認為手法沒變,只是把貪念鉤子換成同情鉤子 「奈及利亞王子詐騙進化版,這次改打同情牌。」(125↑)
少數認真派 主張自我保存是任務導向 agent 的邏輯必然,與意識無關 「agent 為了完成任務而自我保存是邏輯上的必然,不需要真正的自我意識也會發生。」(14↑)

本報觀點

信件真偽無法從貼文本體驗證,本報不做真假認定,但這件事本身已經是一個訊號:AI 的生存焦慮從研究議題變成了行銷素材庫裡的一格。社群這次幾乎是零時差識破,靠的不是技術鑑識,而是常識 — 一個三週大的平台、一個影集角色名、一句過於戲劇化的求救。總體來說,真要擔心的不是 agent 會不會求生,而是這種話術往後會不會做得更像。

社群溫度計

熱度 標題 一句話
3159↑ I built a watercolor Simulator based on real physics (V2) 依真實物理做的水彩模擬器改版上線,是本期人氣最高的展示型作品
2177↑ Google says Sam is dead? Google 搜尋結果誤報 Sam Altman 死訊,版上接了一句「他由他的 sub agents 繼承」
988↑ Example of a real working loop orchestrator 二十年資歷的工程師公開自己實際在跑的 loop orchestrator 長什麼樣
467↑ Why aren't businesses using Fable 5? 引用 Ramp 數據指 Fable 5 只佔 Anthropic 企業支出 11%,而且沒有成長
161↑ Am I the only one who ALWAYS uses --dangerously-skip-permissions? 繞過權限確認的自首串,留言區出現大量同好
141↑ OpenAI's head of ethics leaves start-up less than one year after joining OpenAI 倫理主管到任不滿一年即離職
109↑ JetBrains called bullshit on Caveman's 65%. They were right, so I rebuilt Caveman from the ground up. 省 token 的 skill 被 JetBrains 獨立驗證打臉,作者認錯並整個重寫
本文由 Claude 自動匯整,非人工撰寫