生活分享
神經網路(Neural Network)是什麼:由層與權重組成、能從資料學習的函數
神經網路是由多層簡單單元組成的函數:單元做加權加總,多半再經非線性轉換,權重由資料調整。用雙開關走廊燈的手算示例,說明前向計算、損失、反向傳播與梯度下降,區分訓練與推論,並釐清參數數量、神經元數量與能力的差別,以及它與深度學習、Transformer 的關係。
閱讀時間約 8 分鐘

神經網路是機器學習機器學習(Machine Learning)是什麼機器學習透過資料調整模型,讓它對未見過的輸入做出預測或產生內容。本文用早餐店備料預估的例子,說明特徵、標籤、訓練與測試如何配合,辨別監督學習、非監督學習和強化學習,並解釋資料洩漏、過度擬合與環境改變的影響。讀完能看懂模型為何需要保留測試資料,也能用具體問題判斷一個看似很準的預測是否值得相信。閱讀全文裡的一種模型:它把輸入一層一層轉成輸出,每個單元先做加權加總,通常再經過一道非線性轉換。網路能做什麼,取決於一組叫權重的數字;這些數字不是人逐一寫入,而是用資料反覆調整出來的。
本篇用「兩個開關控制一盞燈」的小任務,手算一次前向計算與一步權重更新,說明訓練與使用為什麼是兩個階段,並交代生物神經元的比喻只用到哪裡。示例的數字是手算的教學設定,沒有實際訓練過。
單元只做兩件事:加權加總與轉換
依 Google 機器學習術語表,神經元做兩步:把每個輸入乘上權重再加總,再把總和交給活化函數(activation function,也常譯作激勵函數)。偏差是另一個由訓練決定的常數。單元排成層:輸入層、輸出層,以及夾在中間、值不直接對外的隱藏層。
生物神經元的比喻要放對位置。Rosenblatt 把感知器(perceptron)說成假設的神經系統或機器,目的是說明智慧系統的基本性質,不深陷特定生物體常屬未知的條件;Google 術語表則說這種單元「模仿」腦中神經元的行為。但兩邊給的運作定義,都只是加總後再做一次轉換。像不像真實神經元要靠神經科學證據回答,這裡只把它當命名的由來。
從感知器到多層網路:中間層會不會學
Rosenblatt 的感知器靠獎懲調整單元的「值」,他自己也寫下限制:辨認刺激之間的關係會變得極難。Rumelhart 等人指出,感知器中間那層的連線是事先固定的,不算會學的隱藏單元;他們的反向傳播讓隱藏單元自己學出需要的特徵。LeCun 等人補充,這個做法在 1970 到 1980 年代被多組人各自發現。
為什麼一定要有非線性轉換
Google 教材示範過:加了隱藏層、但單元只做加權加總,整個網路仍是線性的,因為線性接線性還是線性,多加幾層也學不到非線性關係。所以隱藏層的單元後面要接非線性的活化函數;輸出層接不接,看任務而定,下面的示例就沒接。
常見的有 sigmoid、tanh 與 ReLU,ReLU 是輸入小於 0 就輸出 0,否則原樣輸出。LeCun 等人 2015 年寫到 ReLU 在多層網路通常學得較快,Google 教材至今仍建議先試 ReLU。Cybenko(1989)證明,單一隱藏層、連續 sigmoid 型非線性、有限個單元的前饋網路,能把單位超立方體上的連續函數逼近到任意精度;這是「能表示」,訓練找不找得到是另一回事。
示例:兩個開關控制一盞燈
示例(未實測,手算):走廊兩端各有開關 a 與 b,往上記 1、往下記 0,恰好一個往上燈才亮。(1,0) 與 (0,1) 要輸出 1,(0,0) 與 (1,1) 要輸出 0。只靠一個加權加總後比門檻的單元做不到:把兩個該亮的組合相加、兩個該滅的組合相加,會得到互相矛盾的不等式。
網路採 2 個輸入、2 個隱藏神經元、1 個輸出,共 9 個參數。手挑權重:隱藏一的權重 1、1,偏差 0;隱藏二的權重 1、1,偏差 −1,兩者都用 ReLU;輸出的權重 1 與 −2,偏差 0,不加活化函數。
- (0,0):隱藏值 0 與 0,輸出 0,燈滅。
- (1,0) 或 (0,1):隱藏值 1 與 0,輸出 1,燈亮。
- (1,1):隱藏值 2 與 1,輸出 2 − 2 = 0,燈滅。
權重是手挑的;真實訓練從隨機權重開始,答案也不只一組。
訓練:損失、反向傳播與梯度下降
訓練是反覆執行四步:
- 前向計算:用目前權重算出預測。
- 損失:量預測離答案多遠;Rumelhart 等人用 E = ½ ΣΣ (y − d)²,對每筆樣本的每個輸出加總,y 是輸出、d 是想要的值。
- 反向傳播:用連鎖律由輸出往回算,每個權重變動一點,損失會增減多少(梯度);白話是問每個權重該為誤差負多少責任。
- 梯度下降:把權重往梯度的反方向改一小步,步幅由學習率決定;學習率是人設的超參數。
接上例(示例,手算),隱藏層不變,假設輸出層權重還沒調好,是 1 與 −1.2、偏差 0:輸入 (1,1) 時隱藏值 2 與 1,輸出 0.8,想要 0,損失 0.32。損失對輸出的變化率是 0.8,乘上各自流過的隱藏值,兩個權重的梯度是 1.6 與 0.8,偏差的梯度是 0.8。為了好算,這一步只改輸出層:學習率取 0.1,權重變成 0.84 與 −1.28、偏差 −0.08,輸出降到 0.32。實際訓練時,隱藏層的權重也在同一步更新,要把誤差乘上輸出權重、再看 ReLU 有沒有啟動,一路往回傳,這就是「反向」;連隱藏層一起改,算出的數字會和這裡不同。
但這一步也牽動別的輸入:(0,1) 原本輸出 1,只改輸出層後變成 0.76。權重被所有輸入共用,改一筆會牽動其他筆,所以要看一批樣本的平均梯度、小步重複許多輪;LeCun 等人說的隨機梯度下降,每次只用一小批樣本估計梯度。
訓練完成後權重固定,使用時只做前向計算,不算損失、不改權重。Google 術語表說,訓練是決定權重,推論推論(Inference)是什麼:模型訓練完之後,每次回答都在做的計算推論是用已訓練好的模型處理新輸入、產生輸出的過程,權重在這個階段固定不變。內容拆開語言模型推論的兩段:讀入提示(prefill)與逐個產生(decode),說明首個 token 時間、完整回答時間與吞吐量的差別,分清推論(inference)與推理(reasoning)、雲端與本機,並看懂批次、量化與快取各自省在哪裡。閱讀全文(inference)是用學好的權重做預測。之後若要更新權重,是另一次訓練。
參數、神經元與能力是三件事
上例只有 3 個會計算的單元,卻有 9 個參數:每個隱藏神經元 2 個權重加 1 個偏差,輸出單元也是 2 加 1。隱藏層若加到 100 個神經元,參數就是 100 × (2 + 1) + (100 + 1) = 401。Google 術語表把參數定義為訓練中學到的權重與偏差,學習率則是人給的超參數;詳見模型參數模型參數(Model Parameters)是什麼模型參數是訓練時調整、用來把輸入轉成輸出的數值,例如權重與偏差。本文用簡單算式示例說明參數如何影響預測,區分模型參數、訓練超參數、提示詞與生成設定,並解釋參數量、數值精度和啟用參數為何是不同指標。讀完能更準確閱讀模型規格,理解參數增加不等於知識逐條增加,也不代表每次聊天都在重新訓練模型。閱讀全文。
參數多不代表能力強,還要看架構、訓練資料與損失的設計。LeCun 等人的回顧提醒,模型好不好要看它在訓練時沒看過的測試資料上的表現,也就是泛化能力;Cybenko 的結果也只說夠大的網路能表示,不保證訓練找得到。看到神經元、參數、層數,應再問:在你的任務、沒見過的資料上表現如何。
| 名詞 | 示例裡 | 常見誤解 |
|---|---|---|
| 神經元 | 會計算的單元 | 等同生物神經細胞 |
| 權重與偏差 | 9 個要學的數字 | 人手寫的規則 |
| 活化函數 | 隱藏層後的 ReLU | 可有可無 |
| 學習率 | 0.1,由人設定 | 網路自己學出來 |
和深度學習、Transformer 的關係
Google 術語表稱隱藏層多於一層的神經網路為深度模型;LeCun 等人把深度學習定義為疊起多個簡單非線性模組、由資料學出各層表示的方法。簡單說,神經網路是結構,深度學習深度學習(Deep Learning)是什麼深度學習利用多層神經網路,從資料學習不同層次的表示,常用於影像、語音與文字任務。本文以回收物照片分類為例,說明隱藏層、非線性、訓練和推論的角色,解釋模型可能記住背景而非物品,以及資料、算力與可解釋性的取捨。讀完能分辨深度學習和一般機器學習的關係,也能用新的拍攝條件檢查一個模型是否真的學到有用模式。閱讀全文是用多層結構學出表示的做法。各家界線略有不同:Google 術語表把神經網路定義為「至少含一個隱藏層」的模型,照這個說法,輸入直接接輸出的模型不算;Rumelhart 等人則認為原始感知器的中間層連線固定,不算真正的隱藏單元。本文開頭的說法不以隱藏層劃界,讀時先確認對方用哪一種定義。
Transformer 是網路的一種排法。Vaswani 等人(2017)稱它為完全建立在注意力機制上的網路架構,每層除了自注意力,還有由兩個線性轉換夾一個 ReLU 組成的前饋網路,正是前面的加權加總加非線性。後來的語言模型是否採用、怎麼改,要看各自的技術文件。所以神經網路是上位類別,聊天機器人只是一種用途,分類照片的小網路也是。
想看其他名詞,可以從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文找起。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Rosenblatt 1958:The Perceptron(Psychological Review 65(6),感知器原始論文) · 查證日期:
- Rumelhart、Hinton、Williams 1986:Learning representations by back-propagating errors(Nature 323) · 查證日期:
- LeCun、Bengio、Hinton 2015:Deep learning(Nature 521) · 查證日期:
- Cybenko 1989:Approximation by superpositions of a sigmoidal function(Math. Control Signals Systems 2) · 查證日期:
- Vaswani 等人 2017:Attention Is All You Need(arXiv:1706.03762,Transformer 原始論文) · 查證日期:
- Google Machine Learning Crash Course:Neural networks(單元總覽) · 查證日期:
- Google Machine Learning Crash Course:Nodes and hidden layers · 查證日期:
- Google Machine Learning Crash Course:Activation functions · 查證日期:
- Google Machine Learning Crash Course:Training using backpropagation · 查證日期:
- Google Machine Learning Glossary(neural network、neuron、weight、parameter、backpropagation 等條目) · 查證日期: