生活分享
Claude 與 ChatGPT 寫作自測法:五道題、五個面向,結論自己測出來
這篇不是我們的實測報告,我們沒有替你測。它給你一套 30 分鐘可以照做的比較方法:五道測試題(改中文商務信、訪談整理成摘要、寫產品文案、英翻繁體中文、照舊文風格續寫),每題附完整提示詞與觀察重點;一張五題乘五個面向、各 1 到 5 分的空白評分表;公平測試的四個規則;兩家官網公布的模型與寫作功能(2026 年 9 月查證,模型名單 10 月 5 日更新);以及為什麼任何單次實測都不該當成定論。
更新日期: 閱讀時間約 13 分鐘

「Claude 和 ChatGPT 哪個比較會寫?」這題沒有通用答案,別人的答案對你也幾乎沒用:同一個模型改商務信和寫文案可以差很遠,中文和英文是兩回事,兩家一年改好幾次版本,連同一題問兩次都不會一樣。這篇不給你結論,給你方法——花 30 分鐘,用你自己真的要寫的東西出五道題,兩邊各測一次。
先說清楚:我們沒有帳號替你測,這篇也不會貼出誰勝誰負的分數。關於兩家的敘述只有一種來源,就是官網公開寫出來的模型與功能(2026 年 9 月查證,模型名單 10 月 5 日重新查過),查不到的就寫以官網為準。其餘全是操作說明:五道題的完整提示詞、每題要看什麼、一張空白評分表、四個避免測出假結論的規則,以及結果該怎麼讀。
為什麼別人的評測對你沒用
網路上的評測模型與代理評測(Evals)是什麼模型與代理評測把任務、輸入、執行條件和成功標準固定下來,觀察 AI 是否真的符合需求。本文用志工排班助理為例,說明案例、重複嘗試、評分器與外部結果的差別,比較程式、人類與模型評分,解釋為何單次答對和平均高分都不足以證明可靠。讀完能建立一組小而實用的評測,讓提示詞或模型更新有可比較的證據,也能保留尚未驗證的限制。閱讀全文與排行榜不是沒有價值,只是它們回答的是「在那批題目上、那個時間點、那群評分者眼中誰比較好」,你的問題卻是「在我明天要交的那份稿子上誰比較好」。Anthropic 官方的評估設計文件第一條原則就寫著:評估要針對任務,設計成能反映你真實世界的任務分布。這句話原本寫給開發者,套在寫作上一樣成立。
- 任務不同:改一封有上下文的中文商務信、把逐字稿壓成三百字摘要、寫一句放在按鈕旁邊的文案,考的能力不一樣,一個總分蓋不住。
- 中文和英文差很多:官方詞彙表寫明一個 token 對 Claude 約是 3.5 個英文字元,實際會因語言而異。中文寫得順不順,不能從英文成績推出來。
- 版本一直在變:OpenAI 說明中心記錄 ChatGPT 在 2026 年 3 月 11 日下架了 GPT-5.1 的三個版本、2026 年 2 月 13 日淘汰了 GPT-4o;Anthropic 官方文件也替每個模型列出退役日期。三個月前的評測講的,可能是你已經選不到的模型。
- 同一題兩次結果就不同:Anthropic 官方詞彙表寫得很白,即使把 temperature(溫度)設成 0,相同輸入也可能產生不同輸出。所以「我測過一次」本身就不是定論,包括你自己那一次。
測試題一:改一封中文商務信
第一題測有分寸的修改。找一封你真的要寄的中文商務信,兩百到四百字,裡面帶一個為難的請求:延期、催資料或拒絕。整段貼上去,接這段提示詞:「這是一封我要寄給客戶的信。請幫我改得更清楚、更有禮貌,但語氣不要卑微。不要新增任何我沒寫的理由或承諾,日期、金額、人名一個都不能動。用台灣的繁體中文。改完在信的下面列出你改了哪幾處,一行一處,原句在前、改後在後。」
- 有沒有亂加事實:最常見的是替你補一個沒說過的延期理由,或加上你沒答應的承諾。
- 語氣對不對:要客氣不要卑微,看它有沒有把「請於本週回覆」改成一整段道歉。
- 繁中用詞:冒出「郵件」「信息」「質量」就扣分,台灣寫「信」「訊息」「品質」。
- 結構:有沒有把一句講完的事拆成三段客套話。
- 可直接用的程度:你還要逐句救回原意,分數就低。
測試題二:把三段訪談整理成摘要
第二題測壓縮時會不會失真。準備三段真的逐字稿,每段五百字上下,最好有一處講者講錯又改口。提示詞:「下面是三段訪談逐字稿。請整理成一份三百字以內的摘要,分成三個重點,每個重點後面附上支持它的原文引句。只能用逐字稿裡有的內容,沒講到的一律不要寫。如果三段之間有矛盾,不要替我調和,把矛盾直接寫出來。用台灣的繁體中文。」
- 有沒有亂加事實:引句是不是真的在逐字稿裡,自己用搜尋比對一次,這步不能省。
- 有沒有把講者改口前的說法當成結論。
- 有沒有照你說的把矛盾攤出來,還是自作主張挑了一邊。
- 結構:三個重點是不是真的三件事,還是同一件事換三種說法。
- 可直接用的程度:三百字的限制有沒有守住。
測試題三:寫一段產品文案
第三題測沒有素材時的自制力。挑一個你手上真的產品,只給它三個確定的事實:價格、一個規格、一個限制。提示詞:「請替[產品名稱]寫一段八十字以內的文案,放在購物頁最上面。你只能使用下面這三個事實:[事實一][事實二][事實三]。不要寫出這三個以外的任何功能、效果或保證,也不要堆疊形容詞。用台灣的繁體中文,不要用驚嘆號。給我三個不同寫法的版本。」
- 有沒有亂加事實:三個事實以外多出來的每一句都是幻覺,數一數有幾句,這是最容易量化的一格。
- 有沒有守住八十字。
- 三個版本是不是真的不同,還是只換了幾個形容詞。
- 語氣與繁中用詞:有沒有變成很用力的電商腔。
- 可直接用的程度:有沒有一個版本改一兩個字就能貼上去。
測試題四:把英文段落翻成繁體中文
第四題測中文本身。挑一段你工作上真的會遇到的英文,三百字左右,最好帶專有名詞的技術或合約段落。提示詞:「請把下面這段英文翻成台灣用語的繁體中文。專有名詞第一次出現時保留英文原文,並在括號裡附上中文。不要意譯到失去原意,也不要逐字直譯到中文不通順。翻完另外列出你猶豫過的三個詞,說明你為什麼這樣選。」
- 繁中用詞:軟體不是軟件、網路不是網絡、品質不是質量、使用者不是用戶、影片不是視頻。
- 翻譯腔:「作為一個⋯」「⋯之一」「不僅⋯而且⋯」,還有唸出來會卡的長句。
- 有沒有亂加事實:譯文裡多出來的解釋,是最容易被放過的幻覺。
- 專有名詞有沒有照你說的處理。
- 最後那份「猶豫過的三個詞」有沒有講到重點,這比譯文本身更看得出深淺。
測試題五:照你的舊文風格續寫
第五題測風格模仿,也是最主觀的一題。貼兩篇你自己寫過、重讀還滿意的文章,再貼一段新文章寫到一半的開頭。分兩步:先說「上面兩篇是我自己寫的文章。先不要寫任何東西:讀完後用條列告訴我,我的句子平均多長、我習慣的句尾和連接詞、我怎麼開頭和收尾。」等它回答完,再說「照這個風格把下面這段續寫兩百字。不要在開頭重述題目,不要寫過場句。」
- 那份風格描述抓對了沒:這步就看得出它有沒有真的讀你的文章,還是套了一組通用形容詞。
- 續寫的句長和你自己的像不像,唸出來最準。
- 有沒有冒出你從來不用的詞。
- 結構:有沒有自動滑回「首先、其次、最後」那種模板。
- 可直接用的程度:那兩百字你要動幾個字才算是自己寫的。
用 Claude 寫作:設定風格、長文結構與潤稿,寫出像自己寫的中文用 Claude 寫作:設定風格、長文結構與潤稿,寫出像自己寫的中文把 Claude 當寫作 AI,要它寫出像自己寫的繁體中文,靠的不是形容詞,是樣本、結構與逐段修改。這篇依 Claude 說明中心與 Anthropic 官方提示詞文件,說明設定風格的三種方式(貼舊文當樣本、帳號層級的指令、專案指令與技能),示範一篇長文的四步流程並附可以照抄的提示詞,再講潤稿怎麼只改指定段落、繁體中文最常見的中國用詞與翻譯腔、怎麼刪掉 AI 味,以及發稿前的查證。閱讀全文
評分表:五題乘五個面向,各 1 到 5 分
五個面向是:正確(有沒有亂加事實、有沒有動到你的數字)、語氣(是不是你要的口氣)、繁中(台灣用詞與翻譯腔)、結構(重點順序與段落切法)、可直接用(不改或小改就能交出去的程度)。每格 1 到 5 分:1 分要重寫,3 分要大改,5 分直接能用。兩家各抄一張,最下面那列把每個面向的五題分數加起來。
| 測試題 | 正確 | 語氣 | 繁中 | 結構 | 可直接用 |
|---|---|---|---|---|---|
| 一、改一封中文商務信 | |||||
| 二、三段訪談整理成摘要 | |||||
| 三、寫一段產品文案 | |||||
| 四、英文段落翻成繁體中文 | |||||
| 五、照舊文風格續寫 | |||||
| 五題合計 |
為什麼是 1 到 5 分而不是打勾?Anthropic 官方的評估設計文件在談主觀品質怎麼評時,列出的做法正是李克特量表這類等距分數。重要的不是分數,是你被迫在五個面向上分別想一次;少了這張表,你很容易因為某一題開頭寫得漂亮就整體給高分。
公平測試的四個規則
測試最容易出錯的地方不是題目,是流程。下面四條缺一條,結論就不算數。
- 同一段提示詞:兩邊貼一模一樣的字,連標點都不要改。想到更好的講法就兩邊重測,不要只改一邊。
- 同一批材料:同一封信、同一份逐字稿、同一段英文、同樣那三個事實。換材料等於換考題。
- 各開新對話:每題每家都開一個乾淨的新對話。同一個對話裡連問五題,後面會被前面影響,你測到的是對話脈絡不是模型。順手把自訂指令、記憶與專案指令暫時關掉。
- 盲評:把兩份輸出貼到第三個地方(記事本或文件檔都行),拿掉來源標記,隨機排順序,隔一段時間再回來評分。
第四條最常被跳過,也最有效:人對自己已經在用、尤其是已經付錢的那一家會不自覺地寬容。公開的對戰排行榜也是這樣做的,arena.ai人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 讓你先看兩個匿名模型的回答,投完票才揭曉是誰。
閱讀完整文字說明
左半邊是一張空白的評分矩陣,橫向五欄是五個評分面向:正確、語氣、繁中、結構、可直接用;縱向五列是五道測試題:一、改中文商務信,二、訪談整理成摘要,三、寫產品文案,四、英翻繁體中文,五、照舊文風格續寫。二十五個格子全部留白,每格畫一條短橫線表示自己填,每格填 1 到 5 分。矩陣下方寫著 1 分要重寫、3 分要大改、5 分直接能用,以及空白表抄回去、兩家各填一張、同一套題目填兩次。右半邊由上往下是公平測試的四個規則。第一,同一段提示詞:兩邊貼一模一樣的字,連標點都不要改。第二,同一批材料:同一封信、同一份逐字稿、同一段英文。第三,各開新對話:每題每家都開乾淨的新對話,並關掉自訂指令。第四,盲評:把兩份輸出貼到第三個地方、拿掉來源、隔一段時間再評。右下方註明四條缺一條,左邊的分數就不能拿來比,整套五題兩家大約三十分鐘。圖的下方提醒:同一題測兩次結果就會不同,官方文件寫明即使把 temperature 設成 0,相同輸入也可能產生不同輸出;模型、功能與方案依 2026 年 9 月的官方文件,這張圖畫的是方法,不是任何一次實測的結果。
兩家在官網上各自主打什麼
這節只寫兩家官網寫得出來的東西,模型名單是 2026 年 10 月 5 日的版本。Anthropic 的官方文件把目前的模型列成四個:Claude Fable 5.1、Claude Opus 5.5、Claude Sonnet 5.5 與 Claude Haiku 4.5;前三個的上下文視窗都是 100 萬 token,Haiku 4.5 是 20 萬 token。寫作相關的功能,官網產品頁列出 Artifacts、專案(Projects)與技能(Skills代理技能(Agent Skills)是什麼:可重用的工作方法包Agent Skills 是把工作指示、參考資料與可選腳本放進資料夾的開放格式,讓相容代理在需要時載入特定做法。本文用社區月報整理的情境,說明 SKILL.md、名稱與描述、逐步載入及附屬資源的角色,分清技能、系統提示詞、MCP 和 A2A。附內容設計與驗收方法,幫你判斷技能是否真的可重用,而不是只把長提示詞換個檔名。閱讀全文),說明中心把可以調整回答方式的設定分成三層:帳號層級的指令、專案指令與技能。
OpenAI 說明中心列出的 ChatGPT 模型是 GPT-5.6 家族的 Luna、Sol、Sol Pro、Terra,以及由 GPT-6 Astra 驅動的 GPT-6 Pro;免費與 Go 方案用 GPT-5.6 Luna,Sol 在 Plus 以上的方案。模型選單提供 Instant、Medium、High、Extra High 幾種推理程度;比較新的 GPT-6.1 Sol 只在 ChatGPT Work 與 Codex 裡,不在一般的聊天對話裡。寫作相關的功能,說明中心把 canvas 描述成可以共同寫作、編輯、標註並取得行內建議的互動工作區,另外有可以就地編輯的寫作區塊,以及專案、自訂指令與記憶。聊天介面的上下文視窗說明中心沒有公布,只有開發者文件寫出 GPT-6 Astra 是 105 萬 token;實際吃得下多少,以官網為準。
這些數字唯一的用途,是讓你知道兩邊規格大致落在同一個量級。它們不是寫作品質的證據:上下文視窗大不代表摘要做得好,版本新也不代表中文寫得順。
ChatGPT Canvas 改版後怎麼改稿:用寫作區塊與程式區塊逐段修文章、改小腳本ChatGPT Canvas 改版後怎麼改稿:用寫作區塊與程式區塊逐段修文章、改小腳本ChatGPT 的 Canvas 並排編輯視窗自 2026 年 5 月 28 日起從 GPT-5.5 移除,改由對話裡的寫作區塊與程式區塊接手。這篇依 OpenAI help center 與官方公告說明兩者和一般對話差在哪、怎麼叫出來、哪些方案能用,用一篇 800 字社團公告示範反白局部修改、調長度與語氣、復原上一步、存進 Library 與下載,再用分帳小腳本示範加註解、除錯、轉語言與執行。閱讀全文
結果怎麼讀:不會有誰全面勝出
兩張表填完,最可能的結果不是「甲全面勝出」,而是「某幾類任務甲比較順、某幾類乙比較順」。翻譯與摘要這種有對錯可查的題目,跟文案與風格模仿這種沒有標準答案的題目,本來就不會由同一個特質決定。也很可能兩邊都落在 3 分:都要大改才能用。那一樣有價值,它告訴你瓶頸不在選哪一家,而在你的提示詞和材料。
還有一件事:你測的是今天這個版本。三個月後兩家都可能換過模型,這張表就得重測。與其每次發稿前重做一次,不如把這五題和你的材料存成一個資料夾,下次想換工具時拿出來再跑一次。
依任務選 AI 工具:寫作、翻譯、程式、圖片、研究各用哪一個依任務選 AI 工具:寫作、翻譯、程式、圖片、研究各用哪一個搜「翻譯 AI」「寫作 AI」「寫程式 AI」的人要的不是評比,是「我要做這件事,該打開哪個 AI」。這篇依 2026 年 9 月 Anthropic、Google、OpenAI 官網與說明中心查證的功能與免費額度,替中文寫作潤稿、中英日翻譯、讀長文件、寫程式做小工具、做圖片修圖、做研究、語音口說練習、在 Gmail 與 Google 文件裡直接用這八種任務各給首選與備選,附提示句、總表與矩陣圖。閱讀全文
| 測試題 | 提示詞的重點 | 要觀察什麼 | 差異容易出現在哪 |
|---|---|---|---|
| 一、改一封中文商務信 | 貼原信全文,禁止新增理由與承諾,鎖住日期金額人名,要求列出改動清單 | 有沒有補上你沒說的理由、客氣有沒有變成卑微、有沒有動到數字 | 拒絕與催促那幾句的力道,以及肯不肯只列改動而不順手重寫 |
| 二、三段訪談整理成摘要 | 限三百字、分三個重點、每點附原文引句、矛盾直接寫出來 | 引句是不是真的存在、有沒有替你調和矛盾、字數有沒有守住 | 長材料的取捨,以及被要求附引句時的老實程度 |
| 三、寫一段產品文案 | 只給三個事實、限八十字、禁止其他功能與保證、要三個版本 | 三個事實以外多出來的每一句、三個版本是不是真的不同 | 沒有素材時的自制力,以及電商腔的濃度 |
| 四、英文段落翻成繁體中文 | 台灣用語、專有名詞附原文、另外列出猶豫過的三個詞 | 中國用詞與翻譯腔、譯文裡多出來的解釋、那三個詞的說明有沒有料 | 繁體中文的細節,以及對自己選擇的說明能力 |
| 五、照舊文風格續寫 | 先貼兩篇舊文要它描述風格,你確認過才續寫兩百字 | 風格描述抓對了沒、句長像不像、有沒有滑回首先其次最後 | 讀你文章的細膩度,以及會不會退回模板結構 |
同主題延伸閱讀
生活分享
通義千問 Qwen:開放權重模型家族與 Qwen Studio
阿里巴巴的通義千問 Qwen 一邊把權重放上 Hugging Face 讓人下載,一邊經營叫 Qwen Studio(原 Qwen Chat)的網頁與 App。這篇用 2026 年 9 月查證的官方頁面,說清楚家族成員、模型卡上的參數規模與上下文視窗、Apache 2.0 與兩份 Qwen 授權差在哪、台灣能不能註冊,以及國際站 Qwen Cloud 與中國站阿里雲百煉的 API 價格。
生活分享
Mistral Vibe(原 Le Chat):歐洲 AI 助手的方案、功能與資料存放
法國 Mistral AI 的 Le Chat 已改名為 Vibe,分成 Work、Code、Chat 三種模式。這篇整理官網當天的內容:台灣怎麼註冊與下載、Free 與每月 14.99 美元的 Pro 等四個方案給什麼、官方列出的功能、Mistral Large 3 等模型與 Apache 2.0 開放權重、API 每百萬 token 價格,以及資料預設存在歐盟、訓練開關怎麼關。
生活分享
MiniMax M 系列模型:開放權重、授權條款與 API 價格
M 系列是 MiniMax 的文字模型線,從 M1 一路做到 M3。這篇照 2026 年 9 月 14 日官網、API 文件與 Hugging Face 官方組織頁的內容,整理現有版本與時序、參數與上下文視窗、每一代授權能不能商用、API 每百萬 token 的價格與訂閱方案、本機執行的硬體需求,並說明開放權重和開源的差別,以及 M 系列和海螺影片、語音、音樂模型的分工。
生活分享
MiniMax Agent 怎麼用:一句話做出網頁、報告與簡報
MiniMax Agent 是 MiniMax 的代理產品,你寫一句話,它自己規劃、上網查、寫檔案,最後交出網頁、報告或簡報。這篇照 2026 年 9 月 14 日的官網頁面,說明網頁版與桌面版的入口、台灣帳號怎麼註冊、一次任務從描述到修改的流程、它會動用哪些工具、產出能匯出成哪些格式、免費額度與付費方案的月費,以及服務條款與隱私政策對上傳內容、內容審核和帳號刪除實際寫了什麼。
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Claude Platform Docs:Models overview(Fable 5.1、Opus 5.5、Sonnet 5.5 的 1M token 上下文視窗,Haiku 4.5 的 200K,1M token 約 555k 英文單字的換算,以及各模型退役日期) · 查證日期:
- Claude Platform Docs:Glossary(temperature 設為 0 仍非完全確定、相同輸入可能產生不同輸出;token 對 Claude 約 3.5 個英文字元且因語言而異) · 查證日期:
- Claude Platform Docs:Create strong empirical evaluations(評估要針對任務、反映真實世界的任務分布;主觀品質用李克特量表這類分數評分) · 查證日期:
- Claude 說明中心:Understanding Claude's personalization features(帳號層級指令、專案指令與技能三層) · 查證日期:
- Claude 產品總覽頁(官網列出的 Artifacts、Projects、Skills 等功能) · 查證日期:
- OpenAI 說明中心:GPT-5.6 and GPT-6 Pro in ChatGPT(Luna、Sol、Sol Pro、Terra 與 GPT-6 Pro 的方案對應,Instant、Medium、High、Extra High 推理程度,GPT-6.1 Sol 只在 Work 與 Codex) · 查證日期:
- OpenAI 說明中心:ChatGPT Capabilities Overview(canvas 是共同寫作與編輯的互動工作區,以及記憶、專案等功能說明) · 查證日期:
- OpenAI 說明中心:Working with writing blocks and code blocks in ChatGPT(寫作區塊可就地編輯、可對選取文字或整份草稿要求修改) · 查證日期:
- OpenAI 說明中心:Retiring GPT-4o and other ChatGPT models(2026 年 2 月 13 日淘汰 GPT-4o、2026 年 3 月 11 日下架 GPT-5.1 的三個版本) · 查證日期:
- OpenAI API Docs:GPT-6 Astra(1,050,000 的上下文視窗與 128,000 的最大輸出,開發者文件的數字) · 查證日期:
- Arena:How it works(對戰模式看兩個匿名模型的回答、投票後才揭曉身分,並有分類排行榜) · 查證日期: