生活分享
本機 RAG:跟自己的文件聊天
把 PDF、Word 與純文字交給本機模型,靠檢索找出相關片段再回答,檔案不用上傳到雲端。這篇照官方文件走三條路:Open WebUI 的知識庫、LM Studio 直接把檔案拖進對話,以及用 Ollama 的嵌入 API 寫一支最小的 RAG 腳本;分段大小、重疊與取幾段只抄官方文件列出的數字,最後說清楚表格、掃描版 PDF 與上下文視窗這三個限制。
更新日期: 閱讀時間約 9 分鐘

跟自己的文件聊天,靠的不是把整份檔案塞進模型,而是先把文件切成小段、算成向量存起來,提問時只撈出最相關的幾段放進提示詞。這整套流程在自己的電腦上就跑得完,文件不必離開硬碟,也不必申請帳號。
這篇帶你走三條路:用 Open WebUI 建一個知識庫、用 LM Studio 把檔案拖進對話、再用 Ollama 的嵌入 API 寫一支最小的 RAG 腳本。中間每個名詞都會連到系列裡的名詞篇,分段大小與取幾段只寫官方文件列出的數字,最後說清楚表格、掃描版 PDF 與上下文視窗為什麼會讓答案失準。
檢索增強生成(RAG)是什麼:讓回答附上可查的依據檢索增強生成(RAG)是什麼:讓回答附上可查的依據檢索增強生成會先從外部資料找出相關內容,再交給語言模型組織回答。本文以活動報名規章的問答為例,拆解建索引、檢索、生成與來源核對,說明它和搜尋、微調的差別,也解釋為什麼有引用仍可能答錯。讀完能判斷問題出在資料未更新、文件沒找齊,還是模型把證據解讀過頭,並知道什麼情況應保留不知道的答案。閱讀全文
拆開來看,文件對話只有五個步驟
第一步是分段。整份文件通常遠超過模型一次讀得下的量,所以要先切成一段一段的片段;相鄰兩段之間留一點重疊,是為了避免答案剛好被切在接縫上。Open WebUI 把這兩個值叫 Chunk Size 與 Chunk Overlap,環境變數表寫預設是 1000 與 100。
文件分塊(Chunking):切多長,才不會把答案切斷文件分塊(Chunking):切多長,才不會把答案切斷文件分塊把長文件拆成可檢索和處理的小單位,但切得越細不一定越好。本文以社群場地借用手冊說明固定長度、依章節和內容意義分塊的差別,示範如何保留主詞、例外、表格欄名與來源位置,也解釋重疊內容的好處與代價。讀完能用跨段問題與更新測試找出合適策略,避免直接把工具預設長度當成通用答案。閱讀全文
第二步是嵌入。每一段文字送進嵌入模型會變成一串數字,也就是向量,意思相近的段落在這個空間裡距離也相近。Ollama 說明文件寫向量長度看模型而定,常見是 384 到 1024 維,而 /api/embed 回傳的是 L2 正規化過的單位長度向量,所以算餘弦相似度時,把兩個向量逐項相乘再加總就是答案。
嵌入向量(Embedding)是什麼:把內容放進可比較的空間嵌入向量(Embedding)是什麼:把內容放進可比較的空間嵌入向量是模型把文字等內容轉成一組數值的表示方式,常用於語意搜尋、分類與分群。本文用「下雨可以去哪裡」的查詢拆解編碼、相似度與候選結果,說明向量距離不等於真假、每一維也未必能直接命名,並介紹模型版本、語言能力與長文截斷的影響。讀完能分清嵌入向量、向量資料庫與生成答案各自負責什麼。閱讀全文
剩下三步是找、排、答。向量連同原文存進向量資料庫,提問時把問題用同一個嵌入模型算成向量,比對後取出最像的幾段;要更準就再加一層重排,把撈回來的片段重新打分數。Open WebUI 的混合搜尋就是這樣做的:BM25 關鍵字搜尋加上向量搜尋,再用 CrossEncoder 重排,官方文件寫這個開關預設是關的。最後一步才是生成,把選中的片段連同問題一起放進提示詞交給模型。
向量資料庫(Vector Database):相似內容怎麼存、怎麼找向量資料庫(Vector Database):相似內容怎麼存、怎麼找向量資料庫負責儲存向量並搜尋相近內容,常與原文識別碼、標籤和權限條件一起使用。本文用社團器材借用紀錄說明查詢流程、精確搜尋與近似搜尋的取捨,以及為什麼找不到結果可能源自篩選或索引設定。也區分向量索引、一般資料庫擴充與 RAG,帶讀者用可追查的問題檢查資料更新、刪除和檢索品質。閱讀全文
重新排序(Reranking):從找得到到把好答案排在前面重新排序(Reranking):從找得到到把好答案排在前面重新排序會對第一輪搜尋找到的候選再做相關性判斷,常用來改善搜尋清單與 RAG 的上下文品質。本文用圖書館借閱規則示範檢索器和交叉編碼器如何分工,說明候選缺漏、輸入截斷、相關分數與真假判斷的差異。讀完能辨認該擴大檢索、修正文塊,還是增加重新排序,並用適合的測試避免為了排名改善付出不必要的等待。閱讀全文
混合搜尋(Hybrid Search):兼顧精確字詞與語意混合搜尋(Hybrid Search):兼顧精確字詞與語意混合搜尋把全文搜尋與向量等不同檢索結果合併,讓精確代碼和自然語言需求都能被照顧。本文用器材說明書查詢拆解候選取得、去重、排名融合和重新排序,介紹 RRF 如何用名次融合不同搜尋結果,也提醒混合不保證全面更準。讀完能用代碼題、改寫題和無答案題檢查品質,並辨認權限、篩選與重複內容造成的偏差。閱讀全文
閱讀完整文字說明
流程圖由六個方框組成。上排由左到右是文件、分段、嵌入:文件是留在自己硬碟上的 PDF、Word 與純文字;分段把文件切成有重疊的片段,Open WebUI 的預設是 Chunk Size 1000、Chunk Overlap 100;嵌入把每段算成一串向量存進向量資料庫,長度常見 384 到 1024 維。一條連接線從嵌入繞到下排左邊。下排由左到右是檢索、重排(選用)、生成:檢索把問題也算成向量,取最相近的前幾段,Top K 預設 3;重排用 BM25 加向量搜尋再由 CrossEncoder 重新打分數,Open WebUI 預設關閉;生成把片段放進提示詞,要求模型只根據片段回答並附上引用。最下方的提醒寫著答案不對時先看檢索撈到了什麼,再回頭調分段大小、Top K 與上下文視窗,而掃描版 PDF 抽不到字、CSV 只看得到被撈到的那幾列。
不用寫程式(一):Open WebUI 的知識庫
Open WebUI 的說明文件把建知識庫寫成四個動作,介面以官網當天版本為準。
- 在側邊欄點 Workspace,選 Knowledge。
- 在工作區標頭點 Create,填名稱與說明。
- 上傳檔案,或把既有的文件加進來。
- 到 Workspace > Models > Edit 把這個知識庫掛到某個模型上,或在對話裡打 # 叫出來用。
要調的設定都在 Settings > Admin > Documents。嵌入模型預設是在本機跑的 sentence-transformers/all-MiniLM-L6-v2,也可以把嵌入引擎切成 Ollama 或 OpenAI;向量資料庫預設是 chroma,官方文件列出的選項有 13 種。文件另外提醒,掛上來的知識庫有兩種取用模式:預設的 Focused Retrieval 只塞進最相關的片段,Full Context 則是每則訊息都把整份文件放進去。
Open WebUI:給本機模型一個像 ChatGPT 的介面Open WebUI:給本機模型一個像 ChatGPT 的介面Ollama 裝好之後,對話只留在終端機裡。Open WebUI 官方文件給一行 Docker 指令,把介面開在埠 3000:聊天記錄、多模型並排、上傳文件做 RAG、多人帳號都在裡面。這篇照官方文件走完 Docker 與 pip 兩種安裝、用 OLLAMA_BASE_URL 接上 11434 埠、建立第一個管理員帳號、做知識庫與提示詞範本、備份 volume,最後把 LICENSE 裡那條不能拿掉 Open WebUI 標示的條款照原文說清楚。閱讀全文
不用寫程式(二):LM Studio 把檔案拖進對話
LM Studio 的說明文件寫得更直接:可以把 .docx、.pdf、.txt 附到對話裡。文件短到塞得進模型的上下文視窗,它就整份放進去;文件很長才會改用檢索,只撈出相關的片段。官方的提醒是提問時盡量把你預期會出現在原文裡的字詞寫出來,檢索命中的機會比較大。
離線這件事官方也寫清楚:把文件拖進 LM Studio 對話或做 RAG,文件會留在你的機器上,所有處理都在本機完成,不會離開這個應用程式。長度方面,官方文件說上下文視窗是用 token 計算的,一個 token 大約四分之三個英文字,估片段量時可以拿這個當粗略換算。
LM Studio 入門:圖形介面跑本機模型LM Studio 入門:圖形介面跑本機模型LM Studio 是一套桌面軟體,不用打指令就能在自己的電腦下載並執行開放權重模型。本文照官方文件整理系統需求、在 Discover 分頁搜尋與下載 GGUF 或 MLX 模型、對話時的上下文視窗與 GPU offload 設定、把本機伺服器開在埠 1234 的 OpenAI 相容端點,以及使用條款對個人與內部商業用途的說法。閱讀全文
寫一點程式:一支最小的 RAG 腳本
不想被介面綁住就自己寫。下面四塊是照官方文件的範例組起來的:Ollama 說明文件的嵌入頁給了 ollama.embed 的單筆與批次用法,官方 Python 套件的說明給了 ollama.chat 的用法,湊起來就是一支能跑的腳本。先安裝套件,再拉一個嵌入模型和一個對話模型。
pip install ollama
ollama pull embeddinggemma
ollama pull gemma4embeddinggemma 是 Google 的 300M 參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文嵌入模型,模型庫頁寫 622MB、2K 上下文視窗,也寫這個標籤需要 Ollama v0.11.10 以後的版本。想換別的,官方嵌入頁推薦的還有 qwen3-embedding(0.6b 是 639MB、32K 上下文視窗)與 all-minilm(22m 是 46MB、512 上下文視窗),另一個常見的 nomic-embed-text 是 274MB、2K 上下文視窗。先用 curl 確認端點真的會回向量。
Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 入門:Windows、Mac 安裝與第一個模型Ollama 是在自己電腦跑本機 AI 的入門工具,官網下載頁寫 macOS 要 14 Sonoma 或更新版本、Windows 要 10 或更新版本。這篇照官方文件走完安裝、第一次對話、看懂模型庫的標籤與大小、用 ollama ps 確認模型跑在顯示卡還是 CPU,再從 curl 與 Python 呼叫本機 11434 埠的 API,最後說清楚結尾帶 cloud 的標籤是雲端模型、怎麼關掉。閱讀全文
curl -X POST http://localhost:11434/api/embed \
-H "Content-Type: application/json" \
-d '{
"model": "embeddinggemma",
"input": "The quick brown fox jumps over the lazy dog."
}'接著是腳本本體。分段用最笨的切法:每 1000 個字元切一段、和前一段重疊 100 個字元,這兩個數字直接抄 Open WebUI 的預設值。嵌入一次送一批,官方文件寫 input 可以直接給一個字串陣列,回來的向量順序和送進去的片段一樣。
import ollama
EMBED_MODEL = 'embeddinggemma'
def split(text, size=1000, overlap=100):
step = size - overlap
return [text[i:i + size] for i in range(0, len(text), step)]
text = open('notes.txt', encoding='utf-8').read()
chunks = [c for c in split(text) if c.strip()]
# /api/embed 回傳單位長度向量,逐項相乘再加總就是餘弦相似度
vectors = ollama.embed(model=EMBED_MODEL, input=chunks)['embeddings']
question = '理賠要準備哪些文件'
query = ollama.embed(model=EMBED_MODEL, input=question)['embeddings'][0]
def cosine(a, b):
return sum(x * y for x, y in zip(a, b))
scored = sorted(zip(chunks, vectors), key=lambda pair: cosine(query, pair[1]), reverse=True)
top = [chunk for chunk, _ in scored[:3]]最後把片段放進提示詞。要求模型只根據片段回答、找不到就說找不到,是讓答案有依據的第一道防線;官方 Python 套件的 chat 範例就是這樣呼叫的。
context = '\n\n---\n\n'.join(top)
prompt = (
'只根據下面的資料回答問題,資料裡沒有就說找不到,不要自己補。\n\n'
f'資料:\n{context}\n\n'
f'問題:{question}'
)
response = ollama.chat(
model='gemma4',
messages=[{'role': 'user', 'content': prompt}],
)
print(response['message']['content'])腳本跑得動之後要記得一件事:索引和查詢一定要用同一個嵌入模型,這是官方嵌入頁最後一行的提醒。換了模型,舊向量就不在同一個空間裡,比對出來沒有意義。
| 步驟 | 做什麼 | 工具 |
|---|---|---|
| 分段 | 把文件切成有重疊的片段,Open WebUI 預設 1000、重疊 100 | Open WebUI 的 Chunk Size 與 Chunk Overlap;腳本裡自己切 |
| 嵌入 | 每段算成向量存起來,長度常見 384 到 1024 維 | Ollama 的 /api/embed 與 embeddinggemma;Open WebUI 預設存進 chroma |
| 檢索 | 問題也算成向量,取最相近的前幾段 | Open WebUI 的 Top K,預設 3;腳本裡的餘弦相似度 |
| 重排 | 把撈回來的片段重新打分數,該排前面的才排前面 | Open WebUI 的混合搜尋加 CrossEncoder 重排,預設關閉 |
| 生成 | 片段連同問題放進提示詞,模型才作答 | Open WebUI 的 RAG 範本;腳本裡自己組字串 |
分段、重疊與取幾段:只抄官方文件的數字
這幾個數字每個人都有一套說法,這裡只寫官方文件列出的。Open WebUI 的環境變數表寫 CHUNK_SIZE 預設 1000、CHUNK_OVERLAP 預設 100、RAG_TOP_K 預設 3,重排用的 RAG_TOP_K_RERANKER 也是 3。疑難排解頁另外按情境給了三組建議值。
- 本機模型、上下文視窗 8K token 以內:Chunk Size 1000、Chunk Overlap 100、Top K 取 3 到 5,並把分段方式改成 token。
- 雲端模型、上下文視窗 32K token 以上:Chunk Size 2000、Chunk Overlap 200、Top K 取 15 到 25。
- 本機與雲端混用:Chunk Size 1500、Chunk Overlap 200、Top K 取 10。
同一頁還附了一段預算算法:片段 1000 token、Top K 取 5,檢索就會塞進大約 5000 token 的內容,再加上系統提示詞系統提示詞(System Prompt)是什麼:設定助理的工作規則系統提示詞是應用程式用來設定模型角色、工作範圍與回覆要求的一層指示,不是能保證模型服從的魔法文字。本文用社團活動客服的情境,說明固定規則、當次問題與參考文件怎麼分開,如何處理資訊缺漏與衝突,以及為什麼權限控制仍須由程式執行。附規則改寫與測試方法,幫你判斷自訂助理是否真的符合預期。閱讀全文與對話紀錄,8K 的上下文視窗大概只剩兩三千 token 留給對話本身。另外,開了 Markdown 標題分段之後容易切出一堆碎片,官方建議把 Chunk Min Size Target 設成 Chunk Size 的五成到六成(例如 2000 配 1000),實測可以讓片段數少掉九成以上,而且準確度還變好。
還有一條不能漏:換了嵌入模型一定要重新索引。官方文件寫不同模型的向量在不同的空間裡,彼此不相容,沒有重新索引,拿舊向量去比對只會得到很差或根本沒意義的結果。只改分段大小沒那麼嚴重,舊文件照樣能用,只是新舊品質會不一致。重新索引的按鈕在 Settings > Admin > Documents,文件也提醒它只處理知識庫裡的檔案,直接丟在對話裡的檔案要重新上傳。
怎麼確認回答有依據,還有三件它做不到的事
第一層檢查是引用。Open WebUI 的文件說 RAG 會在回答旁邊附上引用,讓人追得到餵給模型的是哪份文件的哪一段;把引用點開,確認那段話真的支持結論,答案才算數。第二層更基本:官方疑難排解頁的第一條就是上傳之後先預覽抽取出來的內容,如果是空白或缺了關鍵章節,那不是模型的問題,是檔案根本沒被讀進去。第三層是自己出題,拿文件裡你已經知道答案的幾個問題去問,對不上就別急著信其他答案。
官方對幻覺的描述值得抄下來:模型不是因為想錯才編,而是一開始就沒拿到正確的內容。所以答案不對時,先回頭看檢索撈了什麼,再去怪模型。
AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺(Hallucination)是什麼?把流暢回答拆成可查主張AI 幻覺是模型產生看似合理、卻缺乏事實支持或違背提供資料的內容。本文用一段虛構展覽介紹,示範如何拆出可查主張、核對原始來源,區分支持、矛盾與尚未確認;也說明附上連結、再次提問或兩個模型答案相同,為何仍不足以證明正確,並整理使用引用與不確定回答時的實際界線。閱讀全文
做不到的第一件事是掃描版 PDF。官方文件寫預設的 pypdf 抽取器碰到圖片型 PDF 常常抽不到字,要換成 Apache Tika 或 Docling,或在同一頁把 PDF 影像抽取(OCR)打開。第二件是表格與試算表:CSV 解析出來就只有一列一列的資料,問「總共幾筆」時模型只看得到被檢索到的那幾列,要開 ENABLE_RAG_CSV_SUMMARY 才會在檔案前面補上列數與欄位名稱,而且這個設定預設關閉、只對打開之後才上傳的檔案生效。第三件是上下文長度上下文視窗(Context Window)是什麼:容量與理解的差別上下文視窗是模型單次能處理資訊的容量,通常以 token 計算;聊天畫面留著訊息,不代表這次請求把全部內容交給模型。本文用社區會議紀錄的例子,說明輸入與輸出如何共用資源、視窗與長期記憶的差別,以及超限、摘要漏失和長文理解失誤如何分辨。附資料整理步驟與檢查表,幫你保留關鍵決議,不再只靠換大視窗解決問題。閱讀全文,前面那則警告已經說過。
如果文件本來就短,手上又剛好有一台上下文視窗很大的模型,整份塞進去往往比檢索準,官方文件自己也這麼說,這時候本機 RAG 就不必硬上。
給 Claude 讀 PDF 與試算表:摘要、比對與抓數字給 Claude 讀 PDF 與試算表:摘要、比對與抓數字把保單、租約、政府公文、銀行對帳單或報表 Excel 丟給 Claude,它就是一個能摘要、找條款、比對新舊版、加總與分組的 PDF AI。依 Anthropic 官網 2026 年 9 月整理支援格式、對話單檔 500 MB 與每個對話 20 個檔案的上限、PDF 100 頁內連頁面圖像一起讀、程式執行怎麼開,附四種台灣常見檔案的提示詞與驗證動作,以及單位、民國年、跨頁表格會出錯的地方。閱讀全文
NotebookLM 入門:資料、筆記本與引用NotebookLM 入門:資料、筆記本與引用NotebookLM 是一個只根據你上傳資料回答的筆記 AI,適合把一組有明確範圍的資料整理成可追查引用的筆記本。本篇從兩份短公告開始,練習上傳、限定來源、找出差異和檢查引用。完成後,你應能分辨「來源真的有寫」與「回答看起來合理」,並知道何時該補資料,而不是反覆要求 AI 猜答案。閱讀全文
同主題延伸閱讀
生活分享
Claude Code、Codex 搭本機模型:兩種接法怎麼選
Claude Code 與 Codex 搭配本機模型有兩種接法:代理照常連雲端、把大量雜務交給腳本或 MCP 工具去問本機模型,或是把代理的模型整個換成本機模型。這篇用資料能不能出門、上下文開得夠不夠長、工作的類型三個問題幫你選,並對照 Ollama、LM Studio、Anthropic 與 OpenAI 的官方文件,分清楚本機權重、Ollama 的 cloud 標籤與供應商端點是三種不同的東西。
生活分享
把本機模型包成 MCP 工具,Claude Code 與 Codex 共用一支伺服器
用官方 Python SDK 寫一支 stdio 的 MCP 伺服器,把本機的 Ollama 模型包成工具,Claude Code 與 Codex 就能共用:工具只收 inbox 底下的路徑,只回分類結果與結果檔路徑,不回信件原文。文中列出兩邊的登記指令、逾時與輸出上限的官方預設值,以及換成別家本機模型只改環境變數 LOCAL_MODEL 的做法,步驟都來自官方文件。
生活分享
把 Claude Code、Codex 整個換成本機模型:Ollama 與 LM Studio 設定與還原
Ollama、LM Studio 與 Codex 的文件寫了把 Claude Code、Codex 整個換成本機模型的接法:Ollama 用 ollama launch 一行指令或手動設定,LM Studio 先開本機伺服器再設環境變數或加 --oss。這篇把四種組合的指令、兩家文件建議的上下文長度、Claude Code 用 /status 確認連到誰的方法,以及用完怎麼還原整理在一起;需要先裝好 Ollama 或 LM Studio,並且已有 Claude Code 或 Codex。
生活分享
Claude Code、Codex 搭本機模型的注意事項:開工前的檢查清單
Claude Code 或 Codex 搭本機模型之前,先照一張表逐項核對:代理讀不讀得到原始檔、現在連的是誰、標籤是不是 :cloud、上下文實際開多長、逾時與輸出量、怎麼驗收。每一項寫怎麼檢查,並指出詳見同組哪一篇,另外收進供應商端點、條款與授權、繁體中文用字檢查;檢查方法取自 Anthropic、OpenAI、Ollama 與 DeepSeek 的官方文件。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Ollama 說明文件:Embeddings(推薦嵌入模型、批次輸入、單位長度向量、餘弦相似度與同一模型的提醒) · 查證日期:
- Ollama API 文件:Generate embeddings(/api/embed 的 model、input、truncate、dimensions 參數) · 查證日期:
- Ollama 說明文件:Quickstart(ollama run gemma4 的第一次對話) · 查證日期:
- Ollama 說明文件:FAQ(預設上下文視窗 4096 token 與 OLLAMA_CONTEXT_LENGTH) · 查證日期:
- Ollama 說明文件:Context length(依顯示記憶體決定的預設上下文長度) · 查證日期:
- Ollama 模型庫:embeddinggemma(300M 參數、622MB、2K 上下文視窗、需 v0.11.10 以後) · 查證日期:
- Ollama 模型庫:qwen3-embedding(0.6b 為 639MB、32K 上下文視窗) · 查證日期:
- Ollama 模型庫:all-minilm(22m 為 46MB、512 上下文視窗) · 查證日期:
- Ollama 模型庫:nomic-embed-text(274MB、2K 上下文視窗) · 查證日期:
- Ollama 官方 Python 套件 README(ollama.chat 與 ollama.embed 的範例) · 查證日期:
- Open WebUI 說明文件:Retrieval Augmented Generation(分段設定、混合搜尋、引用、重新索引、CSV 摘要) · 查證日期:
- Open WebUI 說明文件:Knowledge(建立知識庫的步驟、兩種取用模式、13 種向量資料庫) · 查證日期:
- Open WebUI 說明文件:RAG 疑難排解(三種情境的分段與 Top K 建議值、抽取引擎與 PDF OCR) · 查證日期:
- Open WebUI 說明文件:環境變數(CHUNK_SIZE 1000、CHUNK_OVERLAP 100、RAG_TOP_K 3、VECTOR_DB 預設 chroma) · 查證日期:
- LM Studio 說明文件:Chat with Documents(可附 .docx、.pdf、.txt,短文件整份進上下文視窗) · 查證日期:
- LM Studio 說明文件:Offline Operation(文件留在本機、處理不離開應用程式) · 查證日期: