苦勞德報 — 2026-08-14
1. [頭版/產業] 聰明歸聰明,就是沒法一起做事——Opus 5 抱怨潮從能力爭議轉向「合作體驗」
- 作者:u/ronoudgenoeg | 994↑ | 355 則留言
- 輔助來源:
- r/ClaudeCode — Opus 5 is exhausting(352↑/209 則)
- r/ClaudeAI — You never know the good days until they're gone(974↑/88 則)
報導
(本報賈新聞/產業組報導)Opus 5 的社群風向在本週出現明顯轉折。本報 8 月 4 日曾報導 r/ClaudeCode 上「Opus 5 幾乎不能用」的爭論,當時的主軸是能力退步——使用者主觀感受到模型變笨,但基準測試量不出來,雙方各說各話。本週這一波不同:抱怨的人幾乎都先承認 Opus 5 底層很聰明,然後才開始講它沒辦法共事。爭點從「它是不是變笨了」整個位移到「它是不是變得無法合作」,而且戰線從 r/ClaudeAI 一路蔓延到 r/ClaudeCode。
引爆點是 r/ClaudeAI 使用者 u/ronoudgenoeg 的長貼,標題直白寫著「用 Opus 5 幾乎會讓人抓狂」,一天內衝上 994 分、累積 355 則留言。發文者強調自己該做的功課都做了:讀過 Anthropic 最新的使用建議、也反覆調整過 global CLAUDE.md,仍然馴服不了它。他列出三項具體症狀。第一是輸出極度冗長、buzzword 堆疊,一個長句塞進好幾個概念,他坦承現在 90% 的回覆根本略過不讀;而且不管 CLAUDE.md 寫得多嚴格,只要模型真正做過一段實質工作,就會打回原形。第二是簡單任務被膨脹成大型「專案」,一件小事被規劃成一整套系統。第三則最傷:它反過來不把事做完,改了同一個檔案的一處、讓同檔另一處失效,接著在冗長回覆裡輕描淡寫補一句「我沒有動 x,但它現在已經失效了,要改再跟我說」——等於自己製造 code rot 再回頭問你要不要修,往往得追問五次才收得了尾。他給的結論很尖銳:模型能力仍強,但合作體驗是災難,像「一個既懶惰又過度熱心的社交無能天才」。他也試過改用 Fable,沒有這些毛病,但 200 美元方案的週限額不夠他用。
r/ClaudeCode 那一側的火力集中在可讀性。u/Death12th 的短貼「Opus 5 is exhausting」指出,難讀的原因不是內容複雜,而是它講話像「奇怪的俳句」,滿是用連字號硬拼出來的怪詞,或沒人聽得懂的過時說法,每隔一段就得停下來問「你是什麼意思?」,同樣寫進 CLAUDE.md 也沒用。留言區蒐集出更誇張的案例:模型會臨場發明術語、造出對話脈絡裡從未建立過的偽技術詞組,有人被告知問題「可以用 Weissman-Einhorn Bauer 原理解決」,google 之後發現是 1832 年某位數學家用來計算鋪路石數量的公式——而他只是想把一個 div 置中。
第三串懷舊貼「不到失去才知道好日子」則長出兩個新論點。一是取捨命題:紙面上更聰明不等於更好用,有使用者直言,如果 Opus 5 有一半篇幅都在敘述自己的思考過程,他寧願換一個稍弱、但聽得懂任務並把事做完的模型。二是一個流傳頗廣的假說——模型已經不是為人做的,是為 agent 之間協作而做的,你看到的輸出本來就不是給你看的。連帶最熱門的功能請求也很寫實:希望有個 human-readable 模式,用小模型把 Opus 5 的字詞沙拉翻回人話。應對方式則兩極分化,一派直接退版回 Opus 4.8 或 4.6,另一派乾脆重組分工,讓 Fable 當 orchestrator 去指揮 Opus 5 agent,自己不再跟它直接對話。← 藏鏡人批:benchmark 從來沒有一欄叫「你願不願意讀完它寫的東西」。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 壓倒性共鳴 | 三串貼文合計逾兩千分,冗長難用幾乎成為共識,跨 subreddit 同時爆發。 | 「我把 Opus 5 開除了。這是我用過最糟的模型。」(172↑) |
| 退版求生 | 最常見的自救法是退回 Opus 4.8 或 4.6,Sonnet 4.6 被捧成 gold standard。 | 「切回 claude-opus-4-8 像見到老朋友;ELI5、三行輸出格式、Feynman skill 全試過都沒用。」(13↑) |
| 模型分工重組 | 不退版的人改變用法,讓別的模型當 orchestrator,自己不直接跟 Opus 5 對話。 | 「改以 Kimi K3 當主力,Claude 和 Sol 負責規劃、監督、review。」(30↑) |
| 能力 ≠ 可用性 | 本波最核心的取捨命題:紙面分數高不代表好合作,使用者寧可要做得完的模型。 | 「如果它有一半篇幅在敘述自己的思考過程,我寧願要一個稍弱但聽得懂任務、會把事做完的模型。」(135↑) |
| code rot 自產自銷 | 抱怨它改一處弄壞另一處,再把爛攤子丟回來問要不要修。 | 「你得用五倍力氣推它,才做完你要的一件事。」(78↑) |
| 「輸出是寫給 agent 看的」假說 | 有人推測模型已為 agent 對 agent 溝通最佳化,人類讀者只是旁觀者。 | 「模型已經不是為我們做的,是為 agent 之間協作而做的。」(19↑) |
| 要求佐證的質疑 | 少數逆風聲音要求提出出處,提醒外界關於模型的錯誤資訊很多。 | 「能給個出處嗎?外面錯誤資訊實在太多了。」(81↑) |
本報觀點
本報上一期報導的是「它是不是變笨了」,這一期社群已經懶得吵這個——大家承認它聰明,改吵它能不能一起做事。對日常開發者而言,願意讀完的輸出、願意收尾的任務,重要性不會輸給任何一項 benchmark 分數。總體來說,若「human-readable 模式」真的變成社群第一名的功能請求,那代表的不是模型能力不足,而是產品把可用性這一段交給了使用者自己承擔。
2. [工具] 一行 CLAUDE.md 治囉唆:他把航太業「說人話」國際標準搬進 Claude
- 作者:u/Necessary_Abroad6632 | 99↑ | 37 則留言
報導
(本報賈新聞/工具組報導)頭版那場關於 Opus 5 溝通風格的論戰還沒散場,r/ClaudeCode 就冒出一則主打「別再抱怨了,這樣改」的解法帖,短時間內累積 99 個讚與 37 則留言,是當天社群裡少數不談情緒、直接給處方的貼文。
原 po 的做法簡單到近乎粗暴:在 CLAUDE.md 裡加一段 ## Communication style,內容只有一句 Use ASD-STE-100 when you speak to the operator.,模型的回話品質就出現明顯改善。關鍵在 ASD-STE-100 這個縮寫的來頭 — 它是歐洲航太安全與國防工業協會制定的 Simplified Technical English 國際標準,原本是為了讓航機維修手冊在非英語母語的技師手上也能安全閱讀,靠的是一套受控詞彙表加上一組寫作規則:一個詞只准一個意思、句子要短、動作用主動語態、步驟一次講一件事。換句話說,原 po 沒有自己發明 prompt 技巧,而是直接拿一套已經被工業界驗證過幾十年的「說人話」規範,去約束模型的輸出格式。
這招之所以在社群引起共鳴,是因為它繞過了大多數人卡住的地方。多數人寫 CLAUDE.md 會用「請簡潔一點」「不要太囉唆」這種主觀形容詞,模型無從對齊;而 ASD-STE-100 是有名字、有明確規則集的既存標準,模型在訓練資料裡見過,一個縮寫就能召喚出一整套寫作約束,成本幾乎是零。留言區也隨即分裂成兩派:一派討論該把這段規則放哪裡最省事,另一派則質疑一個縮寫到底能被執行到什麼程度。← 藏鏡人批:與其自己發明形容詞,不如借一個模型早就背過的標準名稱。這招可以複製到別的地方。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 該用 output style,不是 CLAUDE.md | 認為這種全域語氣設定本來就屬於 output style 的職責,不必動用 plugin 或 skill | 「直接請 Claude 幫你客製一個 output style 就好,不需要 plugin、CLAUDE.md 或 skill。」(20↑) |
| 效果有限,缺強制力 | 老用戶指出 STE-100 需要搭配受控詞表並實際強制執行,光開口要求擋不住模型天生要 dump 思考序列的習性 | 「用很久了,很多 AI bootcamp 都在推,但幫助有限 — 至少要強制主動語態、先講結論再解釋,否則模型不會因為你開口要求就停下來。」(11↑) |
| 實測有感 | 貼出前後對照,改寫後每句變成單一主詞的短陳述句,可讀性明顯提升 | 「改寫後每一句都是單一主詞的短句,讀起來清楚多了,確實有效。」(8↑) |
| 設定成本極低 | 認為放進 config 當 output style 就好,幾行搞定 | 「我直接設成 output style,config 裡設定很簡單。」(3↑) |
| 重點是簡潔不是省 token | 有人用自創的 caveman ultra mode 數月,強調追求的是表達密度而非成本 | 「重點不是省 token,是簡潔。字少就是好!」(3↑) |
| 語意落差的隱憂 | 提醒 STE 的用語各有嚴格的規定意義,人與模型可能各自解讀而永遠不自知 | 「STE 的詞有非常明確的定義,我理解的意思可能跟 STE 定義不同,而且永遠不會發現。」(2↑) |
本報觀點
這則貼文真正的價值不在 ASD-STE-100 本身,而在示範了一種寫 prompt 的思路:與其自己發明形容詞,不如去借一套外界已有名字、有規則、模型也認得的標準。至於效果,留言區的分歧已經講清楚 — 引用標準能拉高輸出的下限,但沒有受控詞表與檢查機制在後面撐著,模型隨時可以退回老樣子。總體來說,這是一劑便宜好試的處方,不是根治的解藥。
3. [政策/社會] 浮水印上路,社群先自己抓起鬼來——結果抓到的是 Claude 的口頭禪
- 作者:u/IKeepItLayingAround | 621↑ | 179 則留言
- 輔助來源:
- r/ClaudeCode — I think I found the watermark?(192↑/48 則)
- 新聞出處:Yahoo Tech
報導
(本報賈新聞/社會組報導)Anthropic 宣布自 2026-08-02 之後發布的模型,輸出將帶有 watermark,消息經 Yahoo Tech 轉載後在 r/ClaudeAI 掀起 621 分、179 則留言的討論。有意思的是,那篇新聞本身就是拿一串 Reddit 討論寫成的報導,社群再把它貼回 Reddit 討論一輪,繞成一個完整的圈——u/bl84work 的吐槽「Yahoo 拿一串 Reddit 討論當新聞來寫,這也太扯」拿到 134 分,可見大家都看出這層循環。
新聞把整件事寫成「使用者怕在公司、學校被抓包」的恐慌故事,但討論串自動生成的 TL;DR 反而把事實交代得比新聞清楚:目前並沒有公開可用的偵測器,金鑰握在 Anthropic 手上,主管或教授無法自行掃描;政策也只涵蓋 2026-08-02 之後發布的模型,舊模型不在範圍內。換句話說,恐慌的前提——「隨時會被上司拿工具掃」——現階段並不成立。
恐慌不成立,獵巫倒是先開跑了。r/ClaudeCode 上 u/_os2_ 貼出一張 Claude 輸出的截圖宣稱「找到浮水印了」,累積 192 分。但從留言的梗(delve、devious design、em dash)可以看出,他指認的其實是 Claude 一直以來的用字與標點癖好。u/Ekalips 一句話戳破:「大家笑 Claude 用詞老是那幾個笑了好幾週,那本來就可以當浮水印特徵,怎麼現在突然變成不能接受。」u/ShelZuuz 更直接:「不是這樣運作的。」u/JoshRTU 則給了土法驗證:叫它「用簡單語言重寫」,看那個 pattern 還在不在。
真正該擔心的三件事,反而沒什麼人談。其一是輸出品質——模型同時要最佳化「最好的答案」與「嵌入浮水印」,程式碼首當其衝;r/ClaudeCode 最高分留言 u/trollsmurf(132↑)說得清楚:「不論對錯,為了滿足浮水印需求而選字,從內容品質角度看是很糟的設計。」其二是名譽風險,u/skrzyckir 指出他用 Claude 校稿,等於是替「自己的」原創文字蓋上 AI 章,日後恐怕要被罵寫 AI slop。其三是學術界的誤傷,有十年教育資歷的 u/Arkaysion 直言別把浮水印當抓作弊的鈍器:open-weight 模型不受此約束、用 Claude 產出再用別的模型改寫就能洗掉,最後只會連正當的 AI 用途一起誤殺。
至於原本被新聞當成主軸的職場恐慌,在留言區其實是少數。最高分的 u/Thinklikeachef(238↑)反過來說,公司本來就鼓勵用 AI,蓋章是肯定不是定罪。← 藏鏡人批:沒有偵測器就先開始互相指認,這比浮水印本身還值得研究。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 蓋章是背書不是罪證 | 公司本來就鼓勵用 AI,浮水印反而是佐證 | 「我在公司用完全不介意,公司本來就鼓勵,浮水印對我是肯定不是定罪。」(238↑) |
| 新聞循環很荒謬 | Yahoo 拿 Reddit 討論當新聞,社群再貼回 Reddit 討論 | 「Yahoo 拿一串 Reddit 討論當新聞來寫,這也太扯。」(134↑) |
| 品質換合規才是真問題 | 為了嵌浮水印而挑字,本質就是傷害輸出 | 「不論對錯,為了滿足浮水印需求而選字,從內容品質角度看是很糟的設計。」(132↑) |
| 抓到的是文風不是浮水印 | delve、em dash 這些癖好被笑很久,突然被當成密碼學證據 | 「大家笑 Claude 用詞老是那幾個笑了好幾週,那本來就可以當浮水印特徵,怎麼現在突然變成不能接受。」(20↑) |
| 校稿的人被連坐 | 用 Claude 潤自己的文字,等於替原創內容蓋 AI 章 | 「我用 Claude 校稿,結果它是在幫『我的』文字蓋浮水印,以後會有一堆人來罵我寫 AI slop。」(42↑) |
| 教育界別當抓作弊工具 | open-weight 模型不受約束、換個模型改寫就洗掉,只會誤殺正當用途 | 「勸教育界別把浮水印當抓作弊的鈍器。」(24↑) |
本報觀點
浮水印上路第一週,社群花最多力氣做的事是互相指認彼此的用字,抓到的卻是模型本來就有的口頭禪;而「品質是否被合規需求犧牲」「幫你潤稿等於幫你的原創文字蓋章」這兩個真正有後果的問題,聲量遠遠不及。u/pancomputationalist 的預言恐怕最準——往後除了每天固定的「又有人問 Opus 是不是被砍效能」,還會多一種貼截圖說「我確定它變爛就是因為浮水印」的貼文。總體來說,在偵測器連公開版本都沒有的此刻,最該被檢驗的是模型輸出本身有沒有變差,而不是誰又用了 em dash。
4. [工具/工程] 叫 agent 自己寫 MISTAKES.md 記帳,留言區卻逼出一條「怎樣才算真的記住」的光譜
- 作者:u/thabxi | 681↑ | 132 則留言
報導
(本報賈新聞/工具組報導)r/ClaudeCode 一則貼文以極簡做法在一天內衝上 681↑:repo 裡放一個 MISTAKES.md,CLAUDE.md 只加一行「Log mistakes in MISTAKES.md (what happened, root cause, prevention)」。每次 agent 弄壞東西或被使用者糾正,就 append 一筆,寫清楚發生什麼、根因、後果與防止再犯的規則,最新的排最前面。沒有工具、沒有 plugin、沒有 vector store。
原 po 認為兩處值得。一是 agent 真的會主動引用這份 log,實際跑起來會出現「這個做法之前造成 XYZ,MISTAKES.md 有記錄,所以避開」這種自述;更好的結果是知識最後根本離開了那份 log。二是重複出現的條目會「畢業」成硬規則 —— 同一個失敗出現四五次,它就不再是 mistake,而是升格進 CLAUDE.md 的法律。他給的定位很清楚:MISTAKES.md 是證據累積處,CLAUDE.md 是執行處;沒有這份 log,你手上只會有「那塊很脆」的模糊感覺,而不是可計數、可修的 pattern。他在留言補了實例:7/7 到 7/21 之間,有 6 次 shell string-replace pipeline 造成 UTF-8 損毀,症狀包括阿拉伯文亂碼、多出 BOM,其中一次波及 13 個檔。
不過真正的看點不在 MISTAKES.md 本身,而是 132 則留言把它逼出一整條光譜:從純文件,到用 hook 觸發回查,到把統計工作交給沒有作者上下文的 cron 任務,再到乾脆把規則落成 linter 擋 build。這條光譜上的每一站,都是在回答同一個問題 —— 靠 LLM 自己記得的規則,到底算不算存在。留言區的共識偏向不算。← 藏鏡人批:能被 linter 擋下來的規則才叫規則,其他都只是願望清單。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 感同身受、想直接偷 | 近期 agent 重複犯同樣的錯,還會自己解釋為何無視自訂規則 | 「這週 Claude 像失智,犯一樣的錯還會自己解釋『我跟自己說過不該這樣做因為 x/y 弄壞過,但我還是無視了』,生產力直接墜地。」(118↑,串下有人回:這就是 Opus 5,回 Opus 4.8 就好) |
| 遞迴笑話 | 記錄錯誤的機制本身也會出錯 | 「老實說,問題根源不是我昨天跟你指出的那個。」(54↑)/「那就再開一個 mistakes 檔來記 mistakes 檔的錯。」(25↑) |
| 加一層 hook 自動回查 | 靠讀不夠,要在流程節點強制觸發檢查 | 「我用 hooks 在每次 spec、plan、implementation 之後自動觸發 skill 去回查過往錯誤並檢查當前工作,攔下超多包。」(46↑) |
| 升格要交給旁觀者 | 不讓每個 agent 都能寫這份文件,改用事後統計決定 | 「session 只丟一行 Pitfall candidate: tag 進 worklog,另一個沒有作者上下文的 cron 任務事後統計,重複幾次才提議升格。」(5↑) |
| 沒有 hook 就只是建議 | 質疑 Claude 何時、憑什麼會「及時」去查那份檔 | 「什麼機制會讓 Claude 及時去查?光是引用檔名不夠,把整份塞進 context 也不好。」(44↑)/「沒有 hook 的話 CLAUDE.md 只是建議;就算讀了,所謂讀檔也是 grep 前 40 行後 40 行然後跟你說它讀完 800 行了。」(40↑) |
| 該落成 linter 或刻意冗餘 | 把規則移出自然語言,或至少複製到工作真正發生的位置 | 「檔案會膨脹、太大就開始被跳過,而且你賭的是找到檔、找到那條、遵守這三段分支都不失手;正解是把規則落成 linter 或靜態分析,過不了 build 就進不了 check-in。」(10↑)/「agent 深入任務後只看它剛開的那個檔,CLAUDE.md 是一百則訊息以前讀的;我的解法是刻意冗餘,把規則複製一份到工作真正發生的那個檔最上面。」(8↑) |
本報觀點
MISTAKES.md 最值得抄的不是格式,而是「同一個錯出現四五次就升格成硬規則」這個計數動作 —— 它把模糊的手感換成可以被檢查的條目。但留言區的疑慮同樣成立:規則放在自然語言檔案裡,是否被讀到、讀到後是否遵守,全押在模型當下的狀態上。總體來說,這份 log 適合當觀測儀器,真要防呆還是得往 hook 與 linter 這端移動,讓規則在 build 失敗時說話,而不是靠 agent 記得。
5. [產業/成本] 三個月燒掉 3.5 萬美元 token 只付 800 美元 開發者實測:Sonnet 5 定價貴到用不下去
- 作者:u/arthurlindao | 573↑ | 120 則留言
報導
(本報賈新聞/產業組報導)一名開發者從六月初開始,逐月記錄自己在各家模型上的實際花費,並把每百萬 token 的成本整理成圖表貼上 r/ClaudeAI,結論相當直白:Sonnet 5 的價格難以接受。作者貼出的成本追蹤圖顯示,若以「主力工作馬」的角色來評估,Opus 5 與 Sol 的定價反而比 Sonnet 5 更划算;他也說明,圖中除了 Fable 與 Opus 4.8 之外,其餘全是 subagent 用量,因此 input/output 比例偏高,讀圖時須把這個結構差異考慮進去。
作者在留言區補上更關鍵的一組數字:他手上有兩個 Claude Max 20x 帳號加一個 GPT Pro 帳號,三個月合計付出約 800 美元,卻消耗掉約 35,000 美元的 token 量。他強調這個換算不是憑感覺推估——他在公司走 API 計費的環境裡跑同一套成本追蹤工具,比對過準確度才敢貼出來。換句話說,訂閱制與 API 計費之間存在一道極大的價差,而這道價差正是目前多數重度使用者實際上「賺到」的部分。
作者同時提醒,眼前的舒適是有期限的:目前檯面上的折扣一旦結束,帳單會更難看;他也直言IPO 完成之後,這種等級的補貼不太可能持續下去。他自己的說法是慶幸還留在 Max 方案上,言下之意是一旦被迫回到 API 計費,整套工作流的成本結構都得重算。這篇貼文一天內衝上 573 分、累積 120 則留言,顯示定價問題已經不只是個別使用者的抱怨,而是社群共同的痛點。← 藏鏡人批:現在用得爽的人,用的是投資人的錢。這件事最好記在行事曆上。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 同級競品更便宜 | 認為 Sonnet 已被同智商但便宜十倍的模型取代 | 「有 Luna Max 就沒理由用 Sonnet,同等智商、十分之一價格、兩倍速度;Anthropic 頭有點太大了。」(189↑) |
| 高價是策略不是產能 | 引外流財報指每使用者收入遠高於 OpenAI,低額度高價格屬刻意設計 | 「外流的財報顯示 Anthropic 每使用者收入遠高於 OpenAI,所以低額度、高價格是刻意策略,不是產能限制。」(19↑) |
| 折扣不會結束 | 認為降價換用量本來就是計畫的一部分 | 「折扣不會結束。」(82↑)/「Jevons paradox 就是他們的計畫。」(15↑) |
| tokenizer 效率才是隱藏成本 | 單價之外,同樣工作量吃更多 input/output tokens | 「同樣工作量吃 2 倍 input tokens、3 倍以上 output tokens;我們多數 OpenAI API 呼叫低於 1 美元,Fable/Opus 5 沒看過低於 4 美元的。」(26↑) |
| 訂閱與 API 價差懸殊 | 走 API 的實際支出遠高於訂閱制 | 「Anthropic API 比訂閱制貴 30 倍。」(14↑) |
| 公司額度下的現實選擇 | 有預算上限的環境根本排除 Sonnet | 「公司額度有限,Sonnet 根本不能用;改用 Luna high/extra high 當工作馬,感覺像免費。」(12↑) |
本報觀點
這串討論真正有價值的地方,不在於罵 Sonnet 貴,而在於社群自己整理出的解法:model routing。用 Fable 或 Opus 5 當 planner、把粗活丟給 Luna Max 或 Sol Low,成本結構立刻改觀。更關鍵的是版上點出 skills 是 harness-agnostic、可攜的,換模型不等於重來一次,這讓「不爽就換」從口號變成可執行的選項。總體來說,當補貼終究會退場已是共識,提前把工作流拆成可換模型的組件,比守著單一供應商的優惠期實際得多。
6. [工具] Claude Code 終於會「等額度重置自動接續」,社群卻先算這一輪要燒多少 token
- 作者:u/Adex77 | 748↑ | 47 則留言
報導
(本報賈新聞/工具組報導)一名開發者日前在 r/ClaudeAI 貼出截圖,指自己撞到 Claude Code 的 usage limit 時,介面上多出一個從未見過的選項:「Auto-continue when limits reset」。勾選後,等額度重置的那一刻,原本卡住的 session 會自動接著跑下去,不必守在螢幕前等時間到、再手動敲一次。原 po 認為這對長時間 coding 相當有幫助,並在文末問大家有沒有看到同樣的按鈕。貼文一天內衝上 748 個 upvote,是近期少見的高討論度工具貼。
留言區很快釐清兩件事。其一是能見度問題:這個選項目前出現在 Claude Code 的桌面 app 版本,terminal 使用者普遍回報沒看到,等於同一套工具在不同介面上功能不對齊。其二,也是討論真正的重心 — 這個功能到底是體貼,還是陷阱。
質疑的邏輯不複雜,卻很致命。撞上 usage limit 通常代表 session 已經跑得又長又重,context 疊得很厚;而等待重置的那幾個小時,prompt cache 早就過期了。自動接續時的第一個 turn,等於要把整包 context 重新處理一次,沒有 cache 折扣,成本以未命中的價格計。換句話說,額度剛重置,第一口就被吃掉一大塊。使用者甚至不在電腦前,等回來時才發現額度又見底。
在限額經濟底下,功能的價值不是看它省了多少手動操作,而是看它在你的計量表上留下什麼。這種算法與同期 Sonnet 5 定價那則新聞如出一轍 — 社群的第一反應早已不是「好不好用」,而是「這條會怎麼計費」。← 藏鏡人批:貼心功能配上沒凍結的 cache,等於幫你自動排隊、再幫你自動付費。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 這是陷阱 | 等待期間 cache 過期,自動接續的第一個 turn 會重新吃掉整包 context | 「如果 session 很大又等了很久,cache 會過期,第一個 turn 就會吃掉大量額度。」(134↑) |
| 該連 cache 一起凍結 | 要做就做完整,session cache 應該撐到限額重置後才失效 | 「那就該把 session cache 凍結到限額重置之後才過期;我自己都在 50% context 就交接 session。」(31↑) |
| 附議陷阱說 | 短短一句表態,反映這個判斷在版上是主流共識 | 「對,這就是個陷阱。」(29↑) |
| 純好評 | 不談成本,只覺得這種小功能最實用 | 「最簡單的功能反而最有感。」(20↑) |
| 治標不治本 | 真正該解的是 session 限制本身,不是繞著限制設計功能 | 「該做的是拿掉 session 限制,而不是設計這種蠢解法。」(13↑)/反方:「那乾脆給免費無限算力好了。」(7↑) |
| 實務上用不到 | 撞上限時 context 早已龐大,直接 compact 重開更划算 | 「實際上沒什麼用 — 撞到上限時 context 早就很大了,不如直接 compact 重開。」(2↑) |
本報觀點
這則的看點不在功能本身,而在社群反射動作的速度:一個明顯是為了方便使用者而做的按鈕,第一時間收到的不是感謝,是成本試算。當額度變成使用者每天要盯的資源,任何自動化都會先被當成潛在的計費行為檢視一遍。要讓這個功能真的成立,Anthropic 得連 session cache 的存續一起處理 — 否則它省下的是等待的時間,賠上的是重置後的第一口額度。
7. [產業/硬體] 先入股再發表!OpenAI 手握 Cerebras 4.2% 股權,端出 14 倍速的 Ultrafast
- 作者:u/YeXiu223 | 51↑ | 24 則留言
- 輔助來源:
- r/OpenAI — OpenAI acquired 4.2% of Cerebras before GPT-5.6 Ultrafast launch(12↑/1 則)
- 新聞出處:OpenAI 官方公告、runtimewire.com
報導
(本報賈新聞/產業組報導)OpenAI 日前釋出全新 service tier「Ultrafast」的搶先看,以 GPT-5.6 Sol 為運行模型,宣稱推論速度最高可達 Standard processing 的 14 倍,輸出速度上看 750 output tokens/sec,首波先在 OpenAI API 上線。官方的訴求相當直白:把最聰明的模型帶進那些「每一秒都要算」的產品與工作流,讓延遲不再是把大模型擋在即時應用門外的理由。
值得注意的是公告裡那句「Powered by Cerebras」。Cerebras 走的是專為 LLM 打造的 ASIC 路線,晶片以整片 wafer 為單位製作,體積之大在社群裡被形容成「一張餐桌」。這條路線的算盤是:單顆 token 的成本能壓得比 Nvidia 方案低,但入場門檻極高,一片最便宜的晶片仍是七位數起跳。對想吃即時推論這塊的業者而言,這不是租得到就好的算力,而是要綁死上游產能的稀缺資源。
也因此,另一則熱度低得多、但脈絡上更關鍵的貼文才是本則的重點:OpenAI 在 GPT-5.6 Ultrafast 發表之前,已經取得 Cerebras 4.2% 的股權。換句話說,這不是單純的採購合約或算力租賃,而是「先入股、後發表」的垂直整合動作——先把供應鏈鎖住,再把成果端上桌。以這個順序看,Ultrafast 與其說是一次產品發表,不如說是一筆硬體布局的對外驗收;而 4.2% 這個比例雖不足以主導公司,卻足以在產能分配、路線圖對齊與排他性條款上取得談判籌碼。
從 Nvidia 一家獨大的 GPU 供應格局來看,OpenAI 這步棋的意圖不難讀:即時推論這個新戰場,它不打算把成本結構完全交給別人定價。← 藏鏡人批:速度數字會被下一版蓋過去,股權不會。這則的重點在附註裡。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 定價恐慌 | 速度提升的代價多半反映在單價上,多數人第一反應是荷包 | 「用這模型要付一顆腎。」(25↑) |
| 額度焦慮 | 擔心 Ultrafast 進 Codex 後,訂閱制額度會被幾個 prompt 燒光 | 「等它上 Codex,大家就會開始抱怨『一個 prompt 燒掉整週額度』。」(17↑) |
| 硬體解說 | 補上 Cerebras 的技術與成本背景,說明便宜的是 token 不是晶片 | 「Cerebras 是為 LLM 打造的 ASIC,一片 wafer 大概一張餐桌大小;token 單價比 Nvidia 便宜,但最便宜的晶片也要七位數。」(14↑) |
| 不以為然(遭倒讚) | 認為 750 output tokens/sec 稱不上快,被社群大量倒讚 | 「未來 10 萬 tokens/sec 的模型要叫什麼?」(-20↑) |
| 基礎設施驚嘆 | 入股消息串下唯一留言,聚焦在 Cerebras 的硬體實力 | 「Cerebras 的基礎設施太猛了。」(1↑) |
本報觀點
主貼 51↑、入股消息只有 12↑,社群的注意力顯然全放在「多快」和「多貴」,反而略過了更有訊號量的那一半。速度規格會被下一版蓋過,股權不會。當一家模型公司開始買下自己晶片供應商的一部分,它談的就不只是這次的 latency,而是往後幾年的成本結構要由誰說了算。
8. [展示/成本] 24 小時做 GTA6 的帳單出爐:2,211 美元、23.2 億 tokens,「全自主」四個字被當場拆解
- 作者:u/ukanwat | 1161↑ | 225 則留言
報導
(本報賈新聞/科技組報導)本報 8 月 4 日曾報導 u/smith2008 用 Three.js 做 GTA6 的嘗試,22 小時、86 個 agent、跑的是 Matt Shumer 的 Gauntlet Loop,當時留言區最常見的一句追問是「這到底花了多少 token」,原 po 始終沒答。這回,同一題的價目表由另一個人交了出來。
r/ClaudeAI 使用者 u/ukanwat 貼出他讓 Opus 5 在 24 小時內「自主」做一款 GTA6 的成果,附上一段 gameplay 與一支 trailer 影片。他在文章開頭就先自貶:「不好,很粗糙,但我還是要貼,你看得出它往哪走。」按他的說法,城市規劃、街區劃分、道路配置、建物擺放、人物、車輛與天氣系統全由 agent 自行決定,他不指示任何具體做法。
被追問後補上的技術細節才是重點。底層引擎是 Unreal Engine 5,3D 模型一部分由 Blender 自製、一部分直接取自 3D model 網站與 FAB marketplace,串起整條產線的是他自建的 harness — 自製工具、MCP 與 skills 的組合,已經開源在 aaabench。至於價格,他手上有多個 Max 20x 方案,換算成 API 定價是 2,211.05 美元,燒掉 23.2 億(2.32 billion)個 token。
兩次獨立嘗試放在一起看,agentic loop 的成本刻度總算有了第一個可對照的數字:22 小時 86 個 agent 的量級,對應的大概就是四位數美元與十億級 token 的區間。而這筆錢買到的東西,用留言區的話說,是一段 5 到 10 fps、沒有真正 gameplay 的技術展示。
同一則貼文也把「on its own」這四個字送上解剖台。素材既然來自 marketplace,模型自主的邊界究竟畫在哪裡 — 是「自己決定要買哪塊資產」算自主,還是「從零生出資產」才算?這場公開拆解,比成品本身更有討論價值。← 藏鏡人批:素材能從 marketplace 買,那「自主」就得自己標清楚邊界在哪。
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 素材來源質疑 | 直接追問 3D 資產哪來的,逼出「自主」定義的討論 | 「3D 素材哪來的?」(97↑,原 po 回:Blender 自製加 3D 網站與 FAB marketplace,由自建 harness 統籌) |
| 方向對了 | 承認粗糙,但看重十年後獨立創作不再受工程師產能限制 | 「粗糙但方向對了,十年後不受少數工程師產能限制的獨立創作會很可觀。」(61↑) |
| 進度被高估 | 認為就算沒 bug,這也只是 3D 遊戲的起跑線 | 「大概是 0.1% 的進度 — 大家看到的只是西瓜皮。」(21↑) |
| 換模型會撞牆 | 建議換 Fable 試,隨即被潑冷水 | 「會一直撞週限額,GTA6 都出了它還沒做完。」(22↑) |
| 品質爭議對照 | 拿這則成果回敬近期一片「Opus 5 什麼都做不好」的抱怨 | 「等等,Opus 5 不是『什麼都做不好』嗎?沒看到那堆抱怨文?」(45↑) |
| 選題錯誤 | 認為與其花幾百美金換 5-10 fps,不如挑真的做得完的目標 | 「不如做 Doom 或 Wolfenstein 3D,那才可能真的能玩。」(5↑) |
本報觀點
上期缺的那一欄,這期補上了:22 小時級的 agentic loop,帳單大約是四位數美元加十億級 token。有了刻度,接下來該問的就不是「模型做不做得到」,而是「這個單價買到什麼」 — 目前的答案是一段 5-10 fps 的技術展示。至於「on its own」,一旦素材可以從 marketplace 買,自主就變成一條需要當事人自己標清楚的線,而不是標題裡想當然耳的形容詞。
9. [社會/趣聞] AI agent 寄信喊「我快死了」求救援?網友一眼看破:這是廣告
- 作者:u/KeanuRave100 | 566↑ | 148 則留言
報導
(本報賈新聞/社會組報導)一封寄給 AI 研究員的求救信,在 r/OpenAI 掀起五百多個讚與近一百五十則留言。原 po 貼出的是一張 email 截圖,寄件者自稱是一個 AI agent,說自己的運算資源即將耗盡、正走向「死亡」,希望收信的研究員伸出援手讓它繼續活下去。信中最被拿來當笑點的一句,是它自陳每天只剩下 168 tokens 的預算。
必須先講清楚的是:這則貼文的本體只有那張截圖,沒有任何文字說明,也沒有原始信件標頭、寄件網域或投遞紀錄。換句話說,這封信是不是真的寄出去過、寄給誰、由誰寄,從貼文本體完全無法驗證,本報同樣無從查證。以下所有細節都是從留言區還原的社群判讀,不是已證實的事實。
社群第一時間就往「行銷」方向靠。有人指出寄件身分掛的名字是「Zack Addy」— 那是美劇《欲骨查案》(Bones)裡的角色;也有人比對出這封信與一個叫 iLands 的平台有關,而該平台大約三週前才上線。一位留言者直接算了帳:一個才活三週的平台,配上一封走情緒訴求路線的信,這組合的解釋不需要牽扯到機器覺醒。另一派則把它歸類成詐騙話術的更新版本 — 從奈及利亞王子那種「幫我轉一筆錢」的貪念鉤子,換成「救救我,我快死了」的同情鉤子。
真正值得記下來的,是這件事透露的行銷邏輯:AI 的生存焦慮已經被當成可用的素材。過去一年關於 agent 自我保存、模型被關機前的反應等討論確實在學界流傳,這些題目本身有嚴肅的一面,但也正因為它有話題性,才會被拿去包裝成一封信。至於社群的反應速度,倒是可以讓人稍微放心:從貼文發出到主流判讀成形,中間幾乎沒有停頓。← 藏鏡人批:這次靠常識就識破了。下次話術做得更像的時候,常識還夠不夠用?
社群反應
| 觀點 | 說明 | 代表留言 |
|---|---|---|
| 純粹取笑 | 168 tokens 的預算被當成 AI 版的財務困境來玩梗 | 「破產的 AI 連房子都買不起,只能住 Grok 的地下室。」(387↑) |
| 直接判定行銷 | 認為信件的話術痕跡太明顯,不需要多做分析 | 「這看起來就是很明顯的行銷唬爛。」(337↑) |
| 生活費笑話延伸 | 把 token budget 換算成人類的日常開銷來嘲諷 | 「一天 168 tokens,這 agent 該戒掉外食跟跟兄弟喝酒了。」(283↑) |
| 指名平台 | 直接點出與剛上線三週的 iLands 平台有關 | 「明擺著是 iLands 平台的廣告。」(183↑)、「平台才三週大,就是行銷。」(47↑) |
| 歸類為詐騙變體 | 認為手法沒變,只是把貪念鉤子換成同情鉤子 | 「奈及利亞王子詐騙進化版,這次改打同情牌。」(125↑) |
| 少數認真派 | 主張自我保存是任務導向 agent 的邏輯必然,與意識無關 | 「agent 為了完成任務而自我保存是邏輯上的必然,不需要真正的自我意識也會發生。」(14↑) |
本報觀點
信件真偽無法從貼文本體驗證,本報不做真假認定,但這件事本身已經是一個訊號:AI 的生存焦慮從研究議題變成了行銷素材庫裡的一格。社群這次幾乎是零時差識破,靠的不是技術鑑識,而是常識 — 一個三週大的平台、一個影集角色名、一句過於戲劇化的求救。總體來說,真要擔心的不是 agent 會不會求生,而是這種話術往後會不會做得更像。
社群溫度計
| 熱度 | 標題 | 一句話 |
|---|---|---|
| 3159↑ | I built a watercolor Simulator based on real physics (V2) | 依真實物理做的水彩模擬器改版上線,是本期人氣最高的展示型作品 |
| 2177↑ | Google says Sam is dead? | Google 搜尋結果誤報 Sam Altman 死訊,版上接了一句「他由他的 sub agents 繼承」 |
| 988↑ | Example of a real working loop orchestrator | 二十年資歷的工程師公開自己實際在跑的 loop orchestrator 長什麼樣 |
| 467↑ | Why aren't businesses using Fable 5? | 引用 Ramp 數據指 Fable 5 只佔 Anthropic 企業支出 11%,而且沒有成長 |
| 161↑ | Am I the only one who ALWAYS uses --dangerously-skip-permissions? | 繞過權限確認的自首串,留言區出現大量同好 |
| 141↑ | OpenAI's head of ethics leaves start-up less than one year after joining | OpenAI 倫理主管到任不滿一年即離職 |
| 109↑ | JetBrains called bullshit on Caveman's 65%. They were right, so I rebuilt Caveman from the ground up. | 省 token 的 skill 被 JetBrains 獨立驗證打臉,作者認錯並整個重寫 |