大型語言模型是怎麼運作的
一個比喻:超級接話高手
想像有一個人,他這輩子讀過人類寫下的大部分公開文字——書、網頁、論壇、程式碼、說明書。 他不記得每一句話的出處,但他對「什麼樣的句子後面通常接什麼」有著驚人的直覺。
你給他一個開頭,他就能接下去,而且接得非常像那麼一回事。
這就是大型語言模型(Large Language Model, LLM)。
它做的事情可以簡化成一句話:
看著目前為止的所有文字,預測下一個字最可能是什麼;印出來之後,再預測下一個。
整段流暢的回答,就是這樣一個字一個字長出來的。
為什麼這個機制能產生「像在思考」的結果
因為要把「下一個字」預測得夠好,模型必須在過程中學會很多東西:
- 文法與語感(不然句子不通順)
- 事實之間的關聯(「台灣的首都是」後面接什麼)
- 推理的形式(「因為…所以…」的模式)
- 不同文體與語氣(公文、詩、程式碼註解)
所以它的「理解」是從大量模仿中長出來的統計直覺,不是查表,也不是邏輯推導。 這解釋了它為什麼既能寫出漂亮的分析,又會在簡單的計數題上翻車。
你一定會遇到的幾個名詞
Token(詞元)
模型不是以「字」為單位,而是以 Token 為單位處理文字。
一個 Token 大約是英文的 34 個字母,中文則大約 1 個字就是 12 個 Token。
為什麼你需要知道? 因為所有的長度限制與計費,都是用 Token 算的。
上下文視窗(Context Window)
模型一次能「看到」的 Token 總量上限,包含你的提問、你貼的檔案、以及它自己的回答。
實際影響:
- 對話太長時,最前面的內容會被擠出視窗,於是它「忘記」了
- 上傳超長文件時,可能只讀到一部分
- 解法:開新對話、把重點重新貼一次、或把長文件拆段處理
溫度(Temperature)
控制生成隨機性的參數。溫度低=保守、穩定、重複性高;溫度高=發散、有創意、也更容易亂講。
一般聊天介面不會讓你調,但你可以用文字達到類似效果: 「請嚴格依據我提供的資料回答」vs「請發想 10 個天馬行空的點子」。
推理模型(Reasoning Model)
近年的一類模型會在回答前先「多想一會兒」,內部展開較長的推導再輸出結論。 對數學、邏輯、程式除錯這類任務明顯更準,代價是速度較慢。
實務建議: 一般寫作、摘要用快的模型;需要多步驟推理或精確計算時,換成推理模型。
多模態(Multimodal)
除了文字,還能處理圖片、聲音、影片的模型。 這是為什麼你可以直接把截圖、照片、PDF 丟進去請它讀。
它不擅長什麼(以及怎麼繞過)
| 不擅長 | 為什麼 | 怎麼繞過 |
|---|---|---|
| 精確計算與計數 | 它在預測文字不是在算數 | 請它「用程式計算」,或自己用計算機驗 |
| 最新消息 | 訓練資料有時間點 | 開啟搜尋功能,或把資料貼給它 |
| 你公司內部的事 | 它沒看過 | 把相關文件貼進去,或建知識庫 |
| 記住上次對話 | 預設每次對話獨立 | 用記憶功能,或每次重貼背景 |
| 明確說「我不知道」 | 它被訓練成要給出回答 | 明講「不確定就說不知道」 |
在提示詞最後加一句:「如果資訊不足或你不確定,請直接說不知道,不要猜測。」 這句話能顯著降低胡說的機率。
小結
- LLM = 非常擅長預測下一個字的模型,不是資料庫
- 所有長度限制都跟 Token 有關,對話太長會「忘記」
- 需要精確計算或最新資訊時,要另外想辦法
- 它不會主動承認不知道,所以你要主動要求
接下來看 為什麼 AI 會說錯話:幻覺與查證。