跳至主要内容

大型語言模型是怎麼運作的

一個比喻:超級接話高手

想像有一個人,他這輩子讀過人類寫下的大部分公開文字——書、網頁、論壇、程式碼、說明書。 他不記得每一句話的出處,但他對「什麼樣的句子後面通常接什麼」有著驚人的直覺。

你給他一個開頭,他就能接下去,而且接得非常像那麼一回事。

這就是大型語言模型(Large Language Model, LLM)。

它做的事情可以簡化成一句話:

看著目前為止的所有文字,預測下一個字最可能是什麼;印出來之後,再預測下一個。

整段流暢的回答,就是這樣一個字一個字長出來的。


為什麼這個機制能產生「像在思考」的結果

因為要把「下一個字」預測得夠好,模型必須在過程中學會很多東西:

  • 文法與語感(不然句子不通順)
  • 事實之間的關聯(「台灣的首都是」後面接什麼)
  • 推理的形式(「因為…所以…」的模式)
  • 不同文體與語氣(公文、詩、程式碼註解)

所以它的「理解」是從大量模仿中長出來的統計直覺,不是查表,也不是邏輯推導。 這解釋了它為什麼既能寫出漂亮的分析,又會在簡單的計數題上翻車。


你一定會遇到的幾個名詞

Token(詞元)

模型不是以「字」為單位,而是以 Token 為單位處理文字。 一個 Token 大約是英文的 34 個字母,中文則大約 1 個字就是 12 個 Token。

為什麼你需要知道? 因為所有的長度限制與計費,都是用 Token 算的。

上下文視窗(Context Window)

模型一次能「看到」的 Token 總量上限,包含你的提問、你貼的檔案、以及它自己的回答。

實際影響:

  • 對話太長時,最前面的內容會被擠出視窗,於是它「忘記」了
  • 上傳超長文件時,可能只讀到一部分
  • 解法:開新對話、把重點重新貼一次、或把長文件拆段處理

溫度(Temperature)

控制生成隨機性的參數。溫度低=保守、穩定、重複性高;溫度高=發散、有創意、也更容易亂講。

一般聊天介面不會讓你調,但你可以用文字達到類似效果: 「請嚴格依據我提供的資料回答」vs「請發想 10 個天馬行空的點子」。

推理模型(Reasoning Model)

近年的一類模型會在回答前先「多想一會兒」,內部展開較長的推導再輸出結論。 對數學、邏輯、程式除錯這類任務明顯更準,代價是速度較慢。

實務建議: 一般寫作、摘要用快的模型;需要多步驟推理或精確計算時,換成推理模型。

多模態(Multimodal)

除了文字,還能處理圖片、聲音、影片的模型。 這是為什麼你可以直接把截圖、照片、PDF 丟進去請它讀。


它不擅長什麼(以及怎麼繞過)

不擅長為什麼怎麼繞過
精確計算與計數它在預測文字不是在算數請它「用程式計算」,或自己用計算機驗
最新消息訓練資料有時間點開啟搜尋功能,或把資料貼給它
你公司內部的事它沒看過把相關文件貼進去,或建知識庫
記住上次對話預設每次對話獨立用記憶功能,或每次重貼背景
明確說「我不知道」它被訓練成要給出回答明講「不確定就說不知道」
一個實用技巧

在提示詞最後加一句:「如果資訊不足或你不確定,請直接說不知道,不要猜測。」 這句話能顯著降低胡說的機率。


小結

  • LLM = 非常擅長預測下一個字的模型,不是資料庫
  • 所有長度限制都跟 Token 有關,對話太長會「忘記」
  • 需要精確計算或最新資訊時,要另外想辦法
  • 它不會主動承認不知道,所以你要主動要求

接下來看 為什麼 AI 會說錯話:幻覺與查證