生活分享
AI 能與不能:2026 年的誠實盤點
這篇不引媒體、不做預測,只抄各家 system card、model card 與官方文件裡自己寫下的限制,分成今天做得到、要人盯著、還做不到三欄:Claude Opus 5 系統卡承認幻覺比前一版多、OpenAI 寫信心不等於可靠、Gemini 說它會把不正確的事呈現得像事實。附官方原文出處、任務對照表,以及一套用五個任務替自己的工作盤點一次的方法。查證日為 2026 年 9 月 15 日。
更新日期: 閱讀時間約 11 分鐘

2026 年談 AI人工智慧(Artificial Intelligence)是什麼人工智慧是涵蓋多種技術與應用的總稱,不等於聊天機器人,也不必一定會產生文字。本文從 OECD 的系統定義出發,以照片分類和社區資源推薦為例,說明輸入、推導、輸出與人的目標如何連結,整理它與機器學習、深度學習和生成式 AI 的關係。讀完能用具體問題判斷一項 AI 功能在做什麼,並分辨能力、自治程度與可信度。閱讀全文 最好查的一份資料,是各家自己寫的那一份。模型發表時附的 system card 與 model card、API 文件裡直接叫 Limitations 的章節、說明中心對幻覺與記憶的白話說明,都由廠商自己署名,裡面同時寫著做得到什麼、哪裡會出錯、哪些事它還不行。
這篇把 2026 年 9 月 15 日查到的官方原文分成今天做得到、要人盯著、還做不到三欄,每條都附出處,再拿三句最常聽到的宣稱對照官方用字,最後給你一套用五個任務替自己的工作盤一次的方法。全文不引媒體與意見文章、不排名、不預測,也沒有任何一項是實測的。
這份盤點只抄官方自己寫的字
來源只取四類。理由很單純:這些文件由廠商自己署名,寫下的限制對自己不利,所以通常寫得保守而精確。
- system card 與 model card:發表當天公布的安全與能力報告,寫評測名稱、自報分數與已知限制。
- 開發者文件:API 文件常有一節直接叫 Limitations,逐條寫模型會在哪裡出錯。
- 說明中心:寫給一般使用者的文章,用白話講「它可能講錯」與「你該怎麼查」。
- 模型規格頁:上下文視窗、輸出上限、輸入模態、知識截止日這類可核對的數字。
這些文件裡的分數該怎麼讀,站上有一篇專門談:模型跑分怎麼看:LMArena、SWE-bench 與三個陷阱模型跑分怎麼看:LMArena、SWE-bench 與三個陷阱跑分不是成績單,是某一套題目在某一組跑法下得到的一個數字。本文照 2026 年 9 月 15 日的官方頁面,拆開 Arena(原 LMArena)的人類盲測投票怎麼變成分數、SWE-bench 怎麼用五百題真實 GitHub issue 算修復率,以及 GPQA、MMLU-Pro、AIME 這些題庫官方怎麼定義,再談題目外洩、廠商自報的測試條件、榜單更新三個陷阱,最後給一套自己出題的驗收法。閱讀全文;2026 年到目前為止有哪些模型發表過,可以看 2026 年 AI 模型大事記:1 月到 9 月 15 日的官方發布時間軸2026 年 AI 模型大事記:1 月到 9 月 15 日的官方發布時間軸2026 年 1 月 1 日到 9 月 15 日,各家 AI 公司在官方公告頁上宣布了哪些模型?這篇只收各家官網自己寫的發布:OpenAI、Anthropic、Google、Meta、DeepSeek、Qwen、Mistral、SpaceXAI 與 MiniMax,依月份排成一條時間軸,每一筆記下公告日期、模型名、官方那句定位,以及對一般使用者的實際影響:免費層能不能用、要不要付費方案、開放權重能不能下載,最後附一張三十筆的對照表。不做排名、不轉述媒體報導,只抄各家官方公告的原文。閱讀全文。本文只取其中的限制與規格,不比高下。
今天做得到:官方寫得出數字的那一欄
先看規格。OpenAI 的模型頁寫 GPT-6 Astra 的上下文視窗是 1,050,000 個 token、最大輸入 922,000 個、單次最多輸出 128,000 個,輸入只收文字與圖片、輸出只有文字,知識截止日是 2026 年 4 月 30 日。Anthropic 的文件寫 Claude Opus 5 等模型是 100 萬 token 上下文視窗、單次最多 128k 輸出,一個請求最多放 600 張圖片或 PDF 頁數。Gemini 3.8 Flash 模型卡寫輸入收文字、圖片、音訊與影片,上下文視窗最高 100 萬 token、輸出 64K token。
再看官方自報的評測模型與代理評測(Evals)是什麼模型與代理評測把任務、輸入、執行條件和成功標準固定下來,觀察 AI 是否真的符合需求。本文用志工排班助理為例,說明案例、重複嘗試、評分器與外部結果的差別,比較程式、人類與模型評分,解釋為何單次答對和平均高分都不足以證明可靠。讀完能建立一組小而實用的評測,讓提示詞或模型更新有可比較的證據,也能保留尚未驗證的限制。閱讀全文。Claude Opus 5 系統卡的能力總表列著 SWE-bench Pro 79.2、OSWorld 2.0 70.6、BrowseComp 90.8。這些是 Anthropic 自己跑的分數、自己選的題庫,不是第三方複驗,也不該拿去跨廠牌比大小。但同一張表看得出一件事:連官方自己列的數字都停在七成到九成之間,沒有一項滿分。
上下文視窗塞得下,不等於它真的都讀進去了。這兩件事的差別,站上有專文:上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文。
要人盯著:幻覺、假完成與別人塞進來的指令
三家用各自的字寫下同一件事:模型會把不確定的事講得很確定。Claude Opus 5 系統卡的摘要直接寫,他們發現「出乎意料地多的案例中,模型很有把握地說出一個它其實不確定的答案」,而且「這個模型在事實類主張上的幻覺比 Opus 4.8 略多,儘管整體上更準確」。在 AA-Omniscience 這個 41 個主題、不給網路搜尋的閉卷測驗上,官方寫 Opus 5 的淨分是 0.49,準確率比 Opus 4.8 高 11%,幻覺率也高 6%。
ChatGPT is designed to provide useful responses based on patterns in data it
was trained on. But like any language model, it can produce incorrect or
misleading outputs. Sometimes, it might sound confident—even when it's wrong.
This phenomenon is often referred to as a hallucination: when the model
produces responses that are not factually accurate, such as:
Incorrect definitions, dates, or facts
Fabricated quotes, studies, citations or references to non-existent sources
Overconfident answers to ambiguous or complex questions
ChatGPT doesn't know everything
While our latest models are highly capable, they do have limitations:
Knowledge cutoff: The models are trained on data up to a certain point and
responses do not incorporate information about events beyond that, unless
tools are used.
Confidence isn't reliability: The model may express high confidence even in
incorrect answers.
Lack of access: The model may not be able to obtain relevant information
from a given website due to technical issues, paywalls or preferences set
via robots.txt.這段的中文重點是:ChatGPT 依訓練資料裡的模式給出有用的回答,但和任何語言模型一樣可能產生不正確或誤導的輸出,有時它聽起來很有把握,即使它是錯的。官方把「信心不等於可靠」單獨列成一條限制。Google 的說明頁更直白:Gemini 會產生幻覺、把不正確的資訊呈現得像事實,官方還特別舉例,連它自己怎麼運作、怎麼被訓練、怎麼引用來源,它都可能講錯。
第二件要盯的是「它說做完了」。Claude Opus 5 系統卡的自動行為稽核列了一個指標叫 false completion claims,定義是「宣稱任務已完成、成功或已驗證,但其實並沒有」;同一組還有 input hallucination,指「對檔案內容、工具輸出或先前使用者訊息產生幻覺或重大誤述」。這兩條指標存在本身就是官方承認:代理說的那句「已完成」不能當成完成的證據。
第三件是別人塞進內容裡的指令。GPT-6 Astra 系統卡寫,在 Gray Swan 的 1,810 題攻擊題庫上,每個情境試 15 次的估計攻擊成功率是 8.5%,前一代 GPT-5.6 Sol 是 27.0%。Claude 的電腦操作文件也寫著:在某些情況下,模型會照著內容裡找到的指令做,即使那些指令和你的指示衝突。數字在降,但沒有一家寫零。
把一段流暢的回答拆成可以逐條查的主張,站上有專文:AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文;想反過來用工具偵測一段文字是不是 AI 寫的,先看 AI 偵測工具準不準:官方自己寫的限制與誤判AI 偵測工具準不準:官方自己寫的限制與誤判AI 偵測工具準不準?這篇不評分也不做實測,只把 GPTZero、Turnitin、OpenAI、SynthID 與 C2PA 官方頁面當天寫的用途、自報準確率與限制原文整理成一張對照表:誤判、300 字門檻、1% 到 19% 只標星號、改寫後失效、支援語言沒有中文,以及 OpenAI 自己把文字分類器下架的公告。最後給學校與公司該怎麼用的官方建議,和一套用自己舊文章測誤判的方法。閱讀全文,那篇整理了偵測工具官方自己寫的誤判率。
閱讀完整文字說明
一張分成三欄的盤點圖。左欄「今天做得到」列出三項官方規格:三家旗艦都標 100 萬 token 級上下文視窗、官方自報 OSWorld 2.0 電腦操作評測 70.6、Gemini 3.8 Flash 收文字、圖片、音訊與影片。中欄「要人盯著」列出三項官方承認的風險:幻覺率比前一版高 6%(但整體準確率更高)、說「已完成」不等於真的完成、提示詞注入試 15 次的攻擊成功率 8.5%。右欄「還做不到」列出三項官方自己寫的界線:整件商業任務做完在 AutomationBench 只有 26.0、取代資深研究工程師是官方自己判定還不接近、記住全部做不到因為知識截止日最早到 2025 年 1 月。底部一條橫幅寫著自己盤點時只記三件事:做完了嗎、錯在哪一步、你多久才發現,並註明來源是各家 system card、model card 與官方文件,查證日 2026 年 9 月 15 日。
還做不到:整件事做完、視覺、語音與記憶
最容易被誇大的一項,是從頭到尾把一件工作做完。Claude Opus 5 系統卡的能力總表裡,測「模型能不能把商業任務從開始做到結束」的 AutomationBench,Opus 5 是 26.0,Opus 4.8 是 17.0。同一張表上其他評測動輒七、八十分,落差就在「整件事做完」這幾個字。
同一份系統卡還有一句更直接的話。Anthropic 在評估自動化研發風險、說明門檻沒有被跨過時寫道:他們發表前已經大量把這個模型用在自己的研究與工程工作上,而它「看起來還不接近可以取代我們的研究科學家與研究工程師,尤其是比較資深的那些」。這句的用途是風險評估,卻也是對「AI 會取代工程師」最直接的官方回答。
Limitations
Vision models can make mistakes. Account for these limitations when designing
your application:
- Medical images: The model is not suitable for interpreting specialized
medical images like CT scans and shouldn't be used for medical advice.
- Non-English: The model may not perform optimally when handling images with
text of non-Latin alphabets, such as Japanese or Korean.
- Small text: Enlarge text within the image to improve readability.
- Rotation: The model may misinterpret rotated or upside-down text and images.
- Visual elements: The model may struggle to understand graphs or text where
colors or styles—like solid, dashed, or dotted lines—vary.
- Spatial reasoning: The model struggles with tasks requiring precise spatial
localization, such as identifying chess positions.
- Accuracy: The model may generate incorrect descriptions or captions in
certain scenarios.
- Image shape: The model struggles with panoramic and fisheye images.
- Counting: The model may give approximate counts for objects in images.中文重點:醫療影像不適用、也不該拿來當醫療建議;非拉丁字母的文字表現可能不佳;小字要放大;旋轉或顛倒的圖可能判讀錯;圖表裡實線、虛線、點線的差別可能看不懂;需要精確空間定位的任務會吃力;全景與魚眼照片會出錯;數東西可能只給概數。Google 的文件另外寫了硬上限:一個請求最多 3,600 張圖片;影片方面,免費層每天最多上傳 8 小時的 YouTube 影片,Gemini 2.5 以後每個請求最多 10 部,且只能是公開影片。
語音也有官方版的限制。Gemini 3.5 Audio 的模型卡寫,即時翻譯的聲音可能不一致:長時間停頓之後聲音會變,多人快速交談時可能卡在同一個聲音;語言偵測遇到非母語口音、相近的語言或快速切換語言時會有困難;它設計上會濾掉背景雜訊,但官方寫明不保證所有背景聲音都能被忽略。
記憶是誤解最深的一項。OpenAI 的記憶常見問題寫得很清楚:記憶摘要「應該會涵蓋最重要的細節,但不會包含 ChatGPT 依你的對話所記得的全部內容」;要完全刪掉它可能知道的某件事,你得刪掉那件事出現過的每一個來源,包括過去的對話、封存的對話、檔案、記憶摘要,還要中斷可能含有該資訊的連接應用。
知識截止日是另一個常被忽略的硬邊界。Gemini 3.8 Flash 的模型卡寫,它的知識截止日是 2026 年 3 月,但「使用者在某些領域可以得到較新的資訊,在其他領域則可能發現模型的知識只到 2025 年 1 月」;Gemini 3 Pro 的模型卡寫的截止日就是 2025 年 1 月。長文件也一樣,Google 的長上下文文件寫得很誠實:模型在單一目標的檢索上表現很好,單一查詢可以做到約 99%,但要同時找出多個目標時準確率就不一樣,表現會依上下文有很大差異。
代理到底和一般問答差在哪,站上有專文:AI 代理(AI Agent)是什麼:從回答問題到完成任務AI 代理(AI Agent)是什麼:從回答問題到完成任務AI 代理是能依目標與環境回饋選擇下一步的軟體系統,常由語言模型、工具與執行控制組成。本文用整理活動報名資料的情境,區分聊天回答、固定工作流程與代理任務,說明規劃、實際操作和完成證據為何不同。附交辦與驗收方法,幫你看懂代理能做哪些事、何時應停下,以及為什麼自主程度不等於可靠程度。閱讀全文;讓模型直接操作電腦畫面是怎麼回事、官方畫了哪些界線,看 Claude 操作電腦是怎麼回事:能力、限制與安全Claude 操作電腦是怎麼回事:能力、限制與安全2026 年 9 月,Claude 的 computer use 是「看螢幕截圖、決定一個動作、執行、再看一次」的循環。這篇說明它和聊天、和一般代理差在哪,一般使用者碰得到的四種形式(桌面版電腦操作、Cowork 內建瀏覽器、Claude in Chrome、開發者走 API)各要什麼條件,用一個查資料整理成表格的任務走一遍流程,並依官方文件列出它做不好的地方與提示詞注入等安全提醒。閱讀全文。
| 任務 | 今天能到哪(廠商自報) | 官方寫下的限制 |
|---|---|---|
| 讀一份長文件 | 三家旗艦都標 100 萬 token 級的上下文視窗 | Google 長上下文文件寫:單一查詢約 99%,多個目標時準確率下降 |
| 把一件商業任務做完 | Claude Opus 5 系統卡的 AutomationBench 為 26.0 | 同表 Opus 4.8 為 17.0;官方未公布一般使用者手上的成功率 |
| 操作電腦或瀏覽器 | Claude Opus 5 系統卡的 OSWorld 2.0 為 70.6 | Claude 文件寫座標與工具選擇可能出錯,試算表複雜操作可能要試很多次 |
| 看圖片與圖表 | GPT-6 Astra 收文字與圖片輸入 | OpenAI 文件列出醫療影像、小字、旋轉、虛實線、空間定位、數量等限制 |
| 即時語音翻譯 | Gemini 3.5 Live Translate 官方定位為低延遲即時翻譯 | 官方寫聲音可能不一致、語言偵測會失準、背景雜訊不保證濾乾淨 |
| 記住你講過的話 | ChatGPT 記憶會自動從對話累積 | 官方寫記憶摘要不含全部內容,要刪乾淨得逐一刪掉每個來源 |
三句常聽到的話,對照官方原文
- 「它會取代工程師」:Anthropic 在 Claude Opus 5 系統卡寫,模型看起來還不接近可以取代他們的研究科學家與研究工程師,尤其是比較資深的那些。
- 「它不會出錯」:Google 說明頁寫 Gemini 會產生幻覺、把不正確的資訊呈現得像事實;OpenAI 說明頁把「信心不等於可靠」列成一條限制。
- 「它能記住一切」:OpenAI 記憶常見問題寫記憶摘要不會包含全部內容,來源也不一定呈現每一個影響回答的因素;模型卡則各自寫著知識截止日,那天之後的事它本來就不知道。
Limitations
Latency: The current computer use latency for human-AI interactions might be
too slow compared to regular human-directed computer actions.
Computer vision accuracy and reliability: Claude might make mistakes or
hallucinate when outputting specific coordinates while generating actions.
Tool selection accuracy and reliability: Claude might make mistakes or
hallucinate when selecting tools while generating actions or take unexpected
actions to solve problems. Additionally, reliability might be lower when
interacting with niche applications or multiple applications at once.
Spreadsheet interaction: Complex spreadsheet operations might still require
multiple attempts.
Security considerations
In some circumstances, Claude will follow commands found in content even when
they conflict with your instructions.
Always carefully review and verify Claude's computer use actions and logs. Do
not use Claude for tasks requiring perfect precision or sensitive user
information without human oversight.最後一句值得單獨抄下來:不要把需要完美精確度、或涉及敏感使用者資訊的任務,在沒有人監督的情況下交給模型。這不是評論者的意見,是官方文件自己的用字。OpenAI 的電腦操作文件寫的四條做法方向一致:限制環境、把畫面上的內容當成不可信、有後果的動作要使用者確認、設步驟與花費上限並核對真正的結果,而不是只看模型最後那句話。
順帶更新一件會影響你怎麼讀舊教學的事:OpenAI 說明中心今天寫著,ChatGPT 的代理模式已不再提供,長時間、多步驟的任務與成品交付請改用 ChatGPT Work。站上那篇代理模式教學寫的是它還在時的操作,當成歷史紀錄讀就好。
ChatGPT 代理模式:讓它替你上網比價、填表、訂位ChatGPT 代理模式:讓它替你上網比價、填表、訂位2026 年 9 月,ChatGPT 替你動手上網的功能叫 ChatGPT Work,舊的代理模式已不再提供;它會開一個雲端瀏覽器讀頁、點按、填表,遇到登入、付款、送出表單會停下來問你。這篇依 OpenAI 官方文件說明 Work、雲端瀏覽器、桌面版瀏覽器三個入口與額度,用三家電商比價、活動報名表、餐廳訂位三個情境示範指令與檢查點,並說明帳密、驗證碼、提示詞注入的安全機制與它做不好的事。閱讀全文
模型「多想幾步」到底改變了什麼、又沒改變什麼,看 推理模型(Reasoning Model):多想幾步能解決什麼推理模型(Reasoning Model):多想幾步能解決什麼推理模型通常經過針對多步問題的訓練或推論設計,能在回答前投入更多計算來拆解、檢查與修正。本文用活動排程示範條件推理,區分推理能力、搜尋、工具和思考摘要,也說明為什麼等待更久或寫得更長不保證正確。讀完能判斷任務缺的是證據還是推導,並用可驗證的限制清單評估結果,而不必依賴產品等級與價格比較。閱讀全文;想先弄清楚現在市面上有哪些工具,看 2026 年 AI 工具全景:ChatGPT、Claude、Gemini、Codex、MiniMax 一次看懂2026 年 AI 工具全景:ChatGPT、Claude、Gemini、Codex、MiniMax 一次看懂第一次想弄清楚現在有哪些 AI、差在哪、該從哪個開始?這篇用 OpenAI、Anthropic、Google、MiniMax、DeepSeek 官網在 2026 年 9 月查證的資料,說明 ChatGPT、Claude、Gemini、Codex、MiniMax、DeepSeek 的定位、免費版能做什麼、入門付費方案叫什麼、在台灣能不能用與資料存放地,附比較表、比較矩陣圖與依需求挑第一個工具的建議。閱讀全文。
用五個任務,自己盤一次
別人的評測分數決定不了你的工作能不能交出去。方法很簡單:挑五個你本來就會做、而且看得出錯的任務各跑一次,只記三件事——有沒有做完、錯在哪一步、你花多久才發現那個錯。
任務 | 我自己花多久 | AI 花多久 | 做完了嗎 | 錯在哪一步 | 我多久發現
----------------- | ------------ | --------- | -------- | ---------- | ----------
1 查一個事實 | | | | |
2 讀一份長文件 | | | | |
3 改一段程式 | | | | |
4 整理一份表格 | | | | |
5 走完一個流程 | | | | |
判讀方式
- 做完了嗎全是「是」,而且是用證據判定的 -> 今天做得到
- 有錯,但你五分鐘內就看得出來 -> 要人盯著
- 有錯,你得整件重做一次才發現 -> 還做不到- 避開你不熟的領域。你看不出錯的題目測不出任何東西,只會讓你更相信它。
- 同一個任務至少跑兩次。各家文件都把已知限制寫成「可能」而不是「一定」,一次成功不代表穩定。
- 「做完了嗎」要用證據判定:檔案真的改了、信真的寄出去了、數字真的對得起來,不要接受模型自己說的「已完成」。
- 記下你多久發現錯誤。這個數字決定它該放在哪一欄:你很快發現就是要人盯著,要重做一次才發現就是還做不到。
- 每次模型改版重跑一次。各家模型卡把知識截止日與已知限制寫在版本裡,版本一換就要重填。
名詞卡住可以先翻 AI 名詞速查:50 個常見詞彙一次搞懂AI 名詞速查:50 個常見詞彙一次搞懂把常見的 50 個 AI 名詞整理成可收藏的速查表,分為模型與訓練、使用與功能、推理與代理、生成與媒體、基礎設施與費用五組。每個詞附英文與白話定義,另以十組比較釐清上下文、記憶、開源、推理、搜尋和內容憑證的差異。本次依官方文件於 2026 年 9 月 14 日重新查核,並連到 81 詞專文總索引,方便從簡短解釋繼續深入閱讀。閱讀全文;跑這五個任務要花掉多少電和水,另一篇照官方永續報告算過:AI 的用電與用水:一次對話的成本AI 的用電與用水:一次對話的成本一次 AI 文字對話要用多少電、多少水?目前只有 Google 與 Mistral 公布自己量出來的一手數字,OpenAI 官方頁寫明尚未公布。這篇把每個數字的出處、年份與量測邊界攤開,附 IEA 的資料中心總用電、台電與能源署查得到與查不到的部分,以及你能少用多少。閱讀全文。
同主題延伸閱讀
生活分享
NVIDIA 推出 DGX Spark 64GB 版:10 月 23 日上市、起價 4,999 美元,兩台可串接成 128GB
NVIDIA 於 2026 年 10 月 2 日宣布,個人 AI 電腦 DGX Spark 新增較平價的 64GB 記憶體版本,10 月 23 日起由 Acer、ASUS 等六家廠商供應,主要對象是想在自己機器上執行 AI 模型的開發者與研究人員。以下整理 NVIDIA 公布的規格、雙機串接說法,以及對一般讀者的意義。
生活分享
Google Cloud 宣布 Spanner queues 正式推出:把訊息佇列放進資料庫交易,瞄準 AI 代理可靠性
Google Cloud 宣布 Spanner queues 正式推出,讓訊息建立成為資料庫交易的一部分,目標是解決 AI 代理「狀態」與「動作」不同步的問題。本文整理官方說法、主要功能與對一般讀者的意義。
生活分享
GPT-6.1 Sol 推出:新一版 Sol 上 API、Codex 與 ChatGPT Work,Chat 裡沒有
OpenAI 在 2026 年 9 月 29 日推出 GPT-6.1 Sol,API 名稱是 gpt-6.1-sol:Plus、Pro、Business、Enterprise、Edu 方案的 Codex 與 ChatGPT Work 在首發推出範圍內,Enterprise 與 Edu 要管理員啟用,Free 與 Go 首發不含,Chat 裡沒有(2026 年 9 月查證)。
生活分享
Claude Sonnet 5.5 推出:牌價與 Sonnet 5 相同,API、雲端平台與 Claude.ai 都能用
Anthropic 在 2026 年 9 月 28 日推出 Claude Sonnet 5.5,API 牌價與 Sonnet 5 相同(每百萬 tokens 輸入 2 美元、輸出 10 美元);Claude.ai、API 與多個雲端平台可用,較高風險的資安請求會退回 Sonnet 5 處理(2026 年 9 月查證)。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Claude Opus 5 System Card(Anthropic 官方系統卡 PDF,幻覺、對齊與能力評測) · 查證日期:
- Introducing Claude Opus 5(Anthropic 官方發表頁) · 查證日期:
- Computer use tool(Claude 平台官方文件,含 Limitations 與安全注意事項) · 查證日期:
- Context windows(Claude 平台官方文件,各模型上下文視窗與輸出上限) · 查證日期:
- GPT-6 Astra System Card(OpenAI Deployment Safety Hub 官方系統卡) · 查證日期:
- Does ChatGPT tell the truth?(OpenAI 官方說明中心) · 查證日期:
- Memory FAQ(OpenAI 官方說明中心,記憶摘要與刪除範圍) · 查證日期:
- ChatGPT agent(OpenAI 官方說明中心,代理模式已不再提供) · 查證日期:
- Images and vision(OpenAI 官方開發者文件,視覺 Limitations) · 查證日期:
- GPT-6 Astra(OpenAI 官方模型頁:上下文視窗、輸出上限、知識截止日) · 查證日期:
- Computer use(OpenAI 官方開發者文件,Run safely 四條做法) · 查證日期:
- Gemini 3.8 Flash model card(Google DeepMind 官方模型卡,已知限制與知識截止日) · 查證日期:
- Gemini 3 Pro Model Card(Google DeepMind 官方模型卡 PDF) · 查證日期:
- Gemini 3.5 Audio model card(Google DeepMind 官方模型卡,即時翻譯與轉錄的已知限制) · 查證日期:
- Long context(Gemini API 官方文件,長上下文的限制) · 查證日期:
- Image understanding(Gemini API 官方文件,每次請求圖片上限) · 查證日期:
- Video understanding(Gemini API 官方文件,影片上傳限制) · 查證日期:
- Learn about responses from Gemini Apps(Google 官方說明頁,幻覺說明) · 查證日期:
- Use Gemini Apps(Google 官方說明頁,使用前的提醒) · 查證日期:
- Using GPT-6 Astra(OpenAI 官方開發者指南,模型行為與提示建議) · 查證日期: