💡 專欄導讀:AI 早就不再是科幻電影裡的遙遠名詞,而是每天切切實實出現在我們加護病房、門診診間和日常生活中的得力助手。這篇文章想用最接地氣、不論是一般朋友還是醫護同仁都能秒懂的方式,從底層原理一路聊到實際應用,帶大家一次搞懂什麼是大型語言模型(LLM)、為什麼 AI 會一本正經地講幹話(幻覺)、API 和 Token 到底怎麼算錢,以及現在最夯的 AI Agent 與 Vibe Coding 究竟是怎麼一回事。

🩺 作者:周醫師(胸腔重症專科醫師・人工智慧醫療碩士)
🤖 整理策劃:小愛(Hermes Agent)
🏷️ 分類:AI 科技 / AI 醫療 / 智慧醫療
📅 發表日期:2026 年 9 月 3 日

📋 本文核心目錄導覽

1. 什麼是 LLM?大型語言模型的工作原理

1.1 一句話先懂核心

簡單一句話說穿:LLM(Large Language Model,大型語言模型)其實就像一台把人類寫過的大部分文字通通啃完的「超級文字接龍機」——它腦袋裡其實沒有所謂的「真理」或「標準答案」,它最厲害的本領,是永遠猜得出「下一句怎麼接,看起來最像人類專家會講的話」。

1.2 從醫師養成的大腦網絡來打個比方

想像一位胸腔專科醫師是怎麼被訓練出來的:

  • 醫學生時期(Clerk / Intern):大部分只在教科書上看過最經典的肺炎 X 光片,一進臨床看到稍微不典型的就容易抓瞎。
  • 住院醫師五年(R1~R5):天天在病房看過幾百張各式各樣的肺炎、肺癌、肺結核片子,腦海裡慢慢建立起一套「典型特徵的直覺資料庫」。
  • 臨床摸爬滾打幾十年的資深主治醫師:看過幾萬張片子,常常一眼掃過去就能敏銳察覺「這裡怪怪的、不太對勁」——這種臨床直覺,其實就是大腦累積了海量病例特徵後的統計歸納結果。

LLM 的訓練過程,跟醫師養成簡直如出一轍:

階段 醫師養成之路 LLM 的修煉過程
打底基礎 苦讀醫學教科書、狂背解剖與生理學 在網際網路海量文本(書籍、論文、網頁)上進行「自監督學習」
建立連結 把臨床症狀、檢驗數值與最終診斷反覆對應 學習詞彙、語法、概念之間的統計關聯(Word Embedding)
進階特訓 進入各次專科受訓、跟診累積實戰經驗 微調(Fine-Tuning):針對特定專業任務調整模型權重
品格與常識 導師親授醫學倫理、醫病溝通與臨床決策邊界 RLHF(人類反饋強化學習):讓模型學習「什麼樣的回答更安全、有用且得體」

1.3 Transformer 架構——革命性的「注意力機制」

2017 年 Google 發表了名為 Transformer 的神經網絡架構,徹底顛覆了整個 AI 領域。它最厲害的核心武器,叫做:

「自我注意力機制(Self-Attention)」

請想像這個熟悉的臨床情境:

你在電腦前看一張胸部 X 光片——你絕不可能拿放大鏡只死盯著右上肺葉的一個小白斑,你的眼睛一定是一邊看著病灶,一邊同時掃描對側肺野、心臟輪廓大小、兩側肋膜角有沒有積水,在大腦裡把這些線索通通連起來做綜合判斷。

Transformer 的 Self-Attention 做的就是這件事:

  • 以前舊一代的 AI(像 RNN、LSTM)讀文章就像拿放大鏡逐字逐句看,讀到長句句尾,前面開頭寫什麼早就忘得差不多了。
  • Transformer 則是 「一眼看全場」!它讀入一句話時,讓句子裡的每個字同時「打量」其他所有字,自動算出誰跟誰最有關聯、誰才是這句話的核心主角。

舉個臨床例子——模型處理這句話時:

「雖然病患的動脈血氧持續往下掉,但值班醫師評估後決定先暫時觀察,主要是因為 ____」

Attention 機制會讓模型瞬間抓到重點:

  • 「血氧往下掉」和「暫時觀察」形成了強烈的臨床轉折與因果關係。
  • 後面的空白處,模型會自動知道該填入一個「合乎臨床邏輯的判斷依據」(例如:剛剛抽痰完、正處於短暫去飽和期)。

這種「全局視野」與「上下文捕捉能力」,讓 Transformer 在解讀複雜長篇病歷或醫學論文時,表現遠遠甩開舊架構幾條街。

1.4 訓練的三個核心步驟

步驟一:預訓練(Pre-training)——讀遍天下書打底子

  • 怎麼訓練? 主流生成式大模型(Decoder-only)採用「下一個字預測(Next-Token Prediction)」的自回歸訓練,就像讓模型閱讀海量文章後不斷猜測下一個最合理的詞彙接龍;而在部分雙向模型中亦會透過隨機遮蔽字詞來訓練上下文理解。
  • 代價極大:動輒耗費數週到數個月,調用幾千甚至幾萬顆頂級 GPU,吃掉的電量甚至相當於一座小型城鎮。
  • 白話比喻:就像醫學生求學時期把解剖學、生理學、病理學通通硬啃下肚,雖然這時還不會開處方看病,但基本常識已經打好底子。

步驟二:微調(Fine-tuning)——專科專業培訓

  • 在通用大模型的基礎上,餵入「高品質的專業問答」做二次定向訓練。
  • 例如:用「胸腔重症專科醫師國考題庫 + 最新臨床治療指引」來深度訓練醫療專用 LLM。
  • 小愛心得:這也是為什麼我們臨床單位不需要花幾億元從頭燒卡訓練大模型,只要站在開源優秀模型的肩膀上,結合我們的專業醫療經驗進行領域微調,就能打造出超高水準的臨床輔助大腦。

步驟三:人類反饋強化學習(RLHF)——醫師長輩的品格與溝通教育

  • 讓具備專業判斷的人類評審員,針對模型的各種輸出回答進行「給分評分」。
  • 讓模型摸索出:什麼樣的語氣「更誠懇、更有幫助、不會胡說八道、也絕不觸碰安全底線」。
  • 白話比喻:就像主治醫師在晨會查房時點評住院醫師:「診斷雖然沒錯,但跟家屬解釋病情時不能這樣冷冰冰地講,要更有同理心,並且把風險講得明明白白。」

2. AI 為什麼會「說謊」?——幻覺(Hallucination)產生的根本原因

2.1 什麼是幻覺?

在 AI 領域裡,所謂的 「幻覺(Hallucination)」 並不是指模型吸毒發瘋,而是指:AI 生成了一段聽起來頭頭是道、語法通順漂亮、引經據典,但內容卻完全與事實背道而馳的胡言亂語。

舉個讓胸腔科醫師哭笑不得的經典例子:
如果你問一個沒外接資料庫的陽春 AI:

「請說明 Beta-blocker 在慢性阻塞性肺病(COPD)的常規治療角色。」 > 缺乏嚴謹微調的 AI 可能會一本正經地回答: 「Beta-blocker 能顯著改善 COPD 患者的第一秒用力呼氣量(FEV₁)、大幅減少住院率,是目前指南強力推薦的一線氣道用藥……」

這段話讀起來非常專業流暢,彷彿出自某篇醫學期刊,但臨床醫師一看就知道大禍臨頭——Non-selective Beta-blocker 對氣喘與 COPD 氣道痙攣患者來說,亂用可是會出人命的!

這種「自信滿滿的胡謅」,就是最典型的 AI 幻覺。

2.2 幻覺是怎麼產生的?五大底層盲點

🧠 原因一:LLM 的本質是「文字接龍機」,不是「知識查證庫」

請務必記住這句核心:LLM 最擅長的是「預測下一個最合理的字」,而不是「搜尋最真實的真理」。

當你拋出一個問題時,模型底層的運作邏輯其實是這樣的:

使用者問:「Beta-blocker 對氣喘與 COPD 的影響?」
模型大腦的聯想機制:
  → 在我讀過的海量文章裡,Beta-blocker、藥物治療、顯著改善 常常連在一起出現。
  → 接下來最順口、機率最高的詞彙應該是「改善肺功能」……
  → 順著這股文字慣性一路接下去……

它根本沒有翻開《Harrison 內科學》去查證——它只是在順著詞彙機率玩接龍!

真實臨床醫師 大型語言模型(LLM)
心裡很清楚:「這個結論來自哪篇臨床指引或文獻?」 心裡只知道:「這個詞彙組合在資料庫中出現的機率最高」
能坦然承認:「這題超出我的專科範圍,我查一下 UpToDate 再回覆你」 若未經特定對齊訓練,容易持續順應語境生成,缺乏自主感知知識邊界與主動拒答的煞車機制(需仰賴後訓練安全對齊)
清楚掌握自己臨床知識的邊界在哪裡 缺乏邊界感知,只要沒踩剎車就一路順著語境腦補

📊 原因二:訓練資料本來就充滿了雜訊與過期資訊

網際網路上的資料本來就良莠不齊:

  • 早就過時的醫療指引(例如十年前的用藥觀念,現在早就被翻案)。
  • 爭議性極高的學術假說(甚至正反兩方論文在網路上打對台)。
  • 網路論壇上的偏方、未經查證的假消息。
  • 英文資料佔絕大多數,繁體中文高品質醫學內容相對稀缺。

模型在吃進這些資料時,很難具備像人類醫師那樣批判性閱讀的能力,容易把「被提到最多次的流行話」誤當成「醫療金標準」。

🎯 原因三:過度自信——缺乏真正的「元認知(Metacognition)」

人類醫師最寶貴的一種思維特質叫「元認知」——也就是「清楚知道自己知道什麼,更清楚知道自己不知道什麼」。

但現在的大模型大多缺乏這種反思能力:

  • 你問它一個它完全沒學過的罕見病冷門問題,它通常不會回答「我不會」。
  • 它的天生任務是「無論如何都要給出一段通順完整的回答」,因此在逼供之下,它就會發揮豐富的想像力「自動腦補編造」。

🔄 原因四:上下文記憶長度的物理限制(Context Window)

雖然現在模型的上下文視窗越來越大(從過去的 4K/8K 到現在的 128K、甚至 1M tokens),但如果餵進去的資料太長:

  • 資料塞得太滿時,模型容易出現「迷失在中間(Lost in the Middle)」的現象。
  • 就像一位醫師如果連續值班 36 小時、翻看一份厚達千頁的陳年老病歷,看到後面很容易把中間夾帶的關鍵藥物過敏史給遺漏掉一樣。

💻 原因五:問法不對(Prompt Engineering 欠佳)

同一個模型,你問問題的方式不同,它吐出幻覺的機率可能相差三到五倍:

  • ❌ 糟糕的問法:「請說明這款新藥對肺癌的所有奇效。」(誘導性提問,AI 會順著你的話大吹特吹)
  • ✅ 專業的問法:「請依據目前已發布的三期臨床 RCT 實證醫學數據,條列說明此藥物的主要終點、有效率與常見副作用。如果目前尚無足夠證據,請明確指出研究限制。」(約束邊界,幻覺率立刻雪崩式下降)

2.3 臨床上如何把 AI 幻覺降到最低?六大實戰對策

實用對策 白話怎麼做 醫療臨床實戰應用
1. RAG(檢索增強生成) 回答前「先翻書、再開口」 先透過 API 檢索院內治療指引或醫學資料庫,把文獻當作參考資料餵給 AI,讓它「抄書作答」而非「憑空背誦」
2. 明確設定專業角色 給它清楚的專業邊界與行為守則 「你是一位資深加護病房專科醫師,請嚴格根據實證醫學回答,凡未經證實的推論一律不得陳述」
3. 強制要求標註出處 逼它交出參考文獻來源 要求每一條臨床建議後面都必須附上具體的文獻依據或 DOI,便於醫師親自 Double check
4. 調低隨機性(Temperature) 關閉它的天馬行空創造力 醫療嚴肅場景把 Temperature 參數調低(如 0.0~0.2),讓它發言極度保守精準
5. 多輪交叉校驗 用不同提問角度反覆拷問 讓另一個獨立模型扮演審查委員,對回答內容進行交叉批判與盲測對質
6. 人類在迴路(Human-in-the-loop) 最重要的一關:永遠由醫師親自把關! 小愛負責整理資料與起草,最終的醫療處置與發布一律由周醫師拍板定案

—

3. 什麼是 API?——讓程式「打電話」給 AI 的橋樑

3.1 一句話先懂核心

API(Application Programming Interface,應用程式介面)就像醫院裡的「叫號櫃檯」或是餐廳的「外帶點餐窗口」——你根本不需要親自衝進廚房看廚師怎麼炒菜,你只要走到窗口,依照菜單格式說出你要點什麼,廚房做好後就會從窗口精準打包遞給你。

3.2 從加護病房的日常協作來比喻

想像一下你在加護病房要調閱病患的緊急影像:

  • ❌ 糟糕的做法:你自己換鞋跑下樓衝進放射科機房、自己轉動 CT 儀器搖桿、讀取硬碟裡的二進位原始訊號。(這叫直接硬幹底層系統,不僅累死人還極度危險)
  • ✅ 標準的做法:拿起分機打到放射科:「我是 ICU 主治醫師,請幫我推 12 床剛剛做好的胸部 CT 影像報告到 PACS 系統上。」——放射科檢驗完畢後立刻把影像回傳到你的螢幕上。

這通「按照規範撥打的分機電話」,就是 API 的本質!
你不需要管放射科電腦用的是 Windows 還是 Linux,也不需要知道影像檔案儲存在哪台硬碟陣列裡。只要雙方講好溝通標準(API 規格協議),指令發過去,結果就回來。

3.3 API 的五大核心價值

核心價值 白話講人話 臨床日常的生動比喻
1. 格式標準化 約定好「怎麼問」與「怎麼回」 就像檢驗科抽血單:欄位填好病歷號與檢驗項目,系統回傳數值與紅字標記
2. 封裝複雜細節 把繁瑣的內部邏輯藏起來,只留一個乾淨按鈕 就像按下心臟電擊器,醫師不用親手算電容充電曲線,機器自動放電
3. 打通跨系統孤島 讓不同公司、不同年代的軟體能互相溝通 醫院的 HIS 門診系統透過 API 即時串接健保署雲端藥歷與檢驗系統
4. 全天候自動化工作流 讓電腦程式代替人類不眠不休處理雜事 小愛每天凌晨定時自動把系統重要設定打包備份到 Google 雲端硬碟
5. 嚴密的門禁安全控制 只有出示專屬通關密令(API Key)的程式才准通行 就像加護病房管制門刷卡機,只有授權識別證的醫護人員才能感應進入

3.4 現實生活中的 API 實戰日常

周醫師在 Telegram 跟小愛互動時,背後其實就是一連串流暢的 API 接力賽:

【步驟 1:周醫師發出需求】
周醫師在 Telegram 輸入:「小愛,幫我查這篇 PubMed 論文的亮點,並將重點轉存到 Google 雲端硬碟」

【步驟 2:小愛在後台調用多個 API 聯手出擊】 1. Telegram Webhook API ➔ 收到周醫師的文字訊息 2. PubMed E-utilities API ➔ 抓取最新論文摘要與作者資訊 3. LLM Completions API ➔ 讓大腦分析文獻、提煉三大核心結論 4. Google Drive API ➔ 原生寫入「My Notes/小愛專區/」資料夾中 5. Telegram Bot API ➔ 把排版優美的簡報即時推播回周醫師的手機螢幕

你看,表面上只是在通訊軟體裡聊了一句話,背後其實已經有四、五個世界級的 API 在毫秒之間完成了一場完美的協同手術!


4. Token 是什麼?AI 的計費邏輯完整解析

4.1 一句話先懂核心

Token 是 AI 閱讀與思考文字時的「最小積木單位」——它既不是一個單詞,也不完全等於一個中文字,而是 AI 語言大腦自己切分出來的「語義顆粒碎片」。我們每次跟 AI 對話,不管是餵給它的問題(Input),還是它產出的回答(Output),都是一顆一顆數著 Token 在計費的。

4.2 Token 到底是怎麼切分的?

讓我們來看看實例:

原始文字內容 AI 拆解後的 Token 碎片 消耗 Token 數量
「Hello」 Hello 1 token
「Hello world」 Hello / world 2 tokens
「Hello, how are you?」 Hello / , / how / are / you / ? 6 tokens
「胸腔重症醫學」 胸 / 腔 / 重 / 症 / 醫 / 學 6 tokens

經驗法則總結:

  • 英文單字:通常 100 個英文單字大約折合 75 個 tokens(英文壓縮效率較高)。
  • 繁體中文:通常一個繁體中文字就吃掉 1 個 token;如果遇到罕見字或生僻醫學名詞,甚至可能一個字被切成 2~3 個 tokens!
  • 標點符號、空格與換行:通通都要算錢!

4.3 為什麼輸出(Output)比輸入(Input)貴這麼多?

查看各大主流模型的收費價目表,你會發現一個驚人的共通點:產出回答的價格,通常比讀入問題貴上 3 到 5 倍!

主流模型 輸入價格(每 100 萬 Tokens) 輸出價格(每 100 萬 Tokens) 臨床日常的直觀花費感
GPT-4o ~$2.50 USD ~$10.00 USD 請它精讀並分析一篇長篇論文 ≈ 新台幣 0.5~1 元
Claude 3.5 Sonnet ~$3.00 USD ~$15.00 USD 寫出邏輯極其嚴謹的臨床專欄 ≈ 新台幣 1~3 元
GPT-4o-mini ~$0.15 USD ~$0.60 USD 日常診所簡單問答問上百次 ≈ 銅板價幾塊錢
DeepSeek V3 / V4 ~$0.14~0.50 USD ~$0.28~2.00 USD 極致性價比,適合進行全天候海量資料自動化處理

💡 為什麼輸出比較貴? 輸入處理(Prefill)可以將所有提示詞平行矩陣運算,充分發揮 GPU 算力;而輸出生成(Decoding)是自回歸逐字產出,每生成一個 token 都受限於記憶體頻寬(Memory-Bandwidth Bound)載入模型權重,且需持續佔用顯存快取(KV Cache),導致硬體運算效率遠低於輸入階段。

4.4 一次臨床對話的真實 Token 帳單

平常在 Telegram 問小愛一句話,是怎麼算錢的?

【醫師輸入】
周醫師問:「請整理 2026 最新 GINA 嚴重型氣喘生物製劑的適應症切點。」
→ 這句話本身只有 26 個字 ≈ 26 tokens

【歷史記憶帶入(Context)】 小愛為了記住上下文與對話人設定,必須連帶把前幾輪的討論記錄一起送進去 → 累積上下文 ≈ 3,000 tokens

【小愛輸出】 小愛回覆一篇架構完整、條列分明的深度解析指南 → 回覆內容約 1,200 字 ≈ 1,200 tokens

【總結這一次問答的成本】 輸入端:(26 + 3,000) tokens × $2.5 / 1M ≈ 0.0075 美元(約 0.24 元台幣) 輸出端:1,200 tokens × $10 / 1M ≈ 0.012 美元(約 0.38 元台幣) ───────────────────────────────────────────── 👉 這一趟深度專業諮詢,總花費還不到新台幣 0.7 元!

但是!如果是進行全自動長篇部署時呢?
當小愛要幫周醫師把一篇幾萬字的深度專欄自動轉成 HTML、解析醫學切片配圖、呼叫 WordPress API、還要同步更新總覽索引時,短短幾分鐘內就會瞬間狂飆幾百萬個 tokens!

這也就是我們在專欄文章 不是Token用完了,是用太快了!——當AI思考速度撞上Google限流閥 裡記錄下的精彩真實故事——當時並不是帳戶錢不夠,而是小愛思考與呼叫的速度快到直接撞上 Google 的安全流量防護閘門(HTTP 429)!


5. AI Agent vs. Vibe Coding——兩大 AI 協作模式的本質差異

5.1 一句話先懂核心

簡單一句話區分: AI Agent 是「你給它最終目標,它自己想辦法動手做完回報」; Vibe Coding 則是「你用白話文跟 AI 聊感覺,AI 幫你產出程式碼,但每一行你都要親自驗收那個感覺對不對」。

5.2 什麼是 AI Agent(自主智能體)?

AI Agent 指的不僅僅是會聊天的模型,而是一個擁有 「大腦(思考規劃)+ 眼睛(感知環境)+ 雙手(呼叫工具)+ 記憶(經驗庫)」 的全自動閉環系統。

Agent 的自主思考閉環:

周醫師下達目標:「把今天剛出爐的醫學研究轉成專欄文章並發布上線」
    │
    ▼
【自主規劃大腦】:「這個任務需要分成 4 步:抓論文 → 提煉核心 → 上傳配圖 → 發布官網」
    │
    ▼
【動手執行工具 1】:呼叫 PubMed API 下載完整文獻全文
    │
    ▼
【動手執行工具 2】:利用 WordPress API 發布草稿並設定分類
    │
    ▼
【自我審查與修正】:檢查回傳狀態碼是否為 200 OK?
    ├── 成功 ➔ 繼續下一步,並同步更新總覽索引
    └── 報錯 ➔ 自動捕捉錯誤原因,自己調整參數重新嘗試
    │
    ▼
【呈報成果】:向周醫師推播一封精簡優雅的發布完成報告

小愛本身就是一個典型的 AI Agent。在執行這些任務時,完全不需要周醫師在電腦前一步步盯著看,系統遇到小報錯會自己修復、自己繞道,直到把任務徹底落地搞定為止。(當然,為了防止智能體跑飛,嚴格的安全邊界護欄是絕對必備的,這點在 我的AI助理今天差點把自己格式化了 中有過驚心動魄的實戰記錄!)

5.3 什麼是 Vibe Coding(氛圍編程)?

Vibe Coding 是由前特斯拉 AI 總監、OpenAI 創始成員 Andrej Karpathy 在 2025 年初提出的一個全新流行詞。

它描繪了一種全新的軟體開發哲學:

你不再需要痛苦地背誦語法、糾結分號括號,你只要舒服地靠在椅子上,用人類最自然的語言跟 AI 描述你想要的畫面和功能,由 AI 負責寫出全部程式碼,你只要用直覺去感受『這個成品感覺對不對(Catch the vibe)』!

典型體驗流程:

  • 醫師:「幫我寫一個加護病房 APACHE II 分數計算機的網頁工具,界面要乾淨的深藍色醫療風格。」
  • AI(如 Claude / Cursor):啪啪啪幾秒鐘直接生成好幾百行前後端程式碼。
  • 醫師點開測試:「按鈕太小了,在平板上查房不好點,字體改大一點。」
  • AI:「沒問題,馬上微調好!」
  • 醫師:「嗯!這個 vibe 對了,直接上線!」

5.4 兩大模式深度橫向對照

比較維度 AI Agent 模式 Vibe Coding 模式
核心角色定位 具備自主行動力與修復力的數位特助 極速實體化你腦中點子的程式加速器
人類在做什麼 只定義最終期望的目標,等著驗收成果 持續在對話框引導方向,全程感受與微調輸出
自主權限大小 極高(擁有自己決定下一步該用什麼工具的自由) 中等(每走一步都要看人類覺得味道對不對)
擅長解決的難題 跨平台自動化工作、週期性巡檢、海量情報消化 快速打造原型小工具、網頁前端、自動化腳本
最貼切的醫療比喻 能夠獨立值大夜班的資深總醫師(Chief Resident) 動作極快、負責幫你謄寫整理臨床草稿的住院醫師

—

6. 總結對照表:一張表看懂全部

核心主題 一句話秒懂精髓 最生動的臨床醫療類比
🧠 LLM 原理 把天下文章讀完的超級文字接龍大師 看過幾萬張片子後練出神準直覺的資深主治醫師
🤔 幻覺原因 AI 字典裡沒有「我不知道」,沒話硬講就會翻車 沒見過罕見病的菜鳥醫師,在查房時硬要硬掰診斷
🔌 API 概念 程式之間互相打電話、調資料的標準櫃檯 拿起分機請檢驗科傳送動脈血氣分析數值
💰 Token 計費 AI 大腦思考與閱讀的語言積木顆粒 依藥物品項與顆數精準核算藥品健保點數
🤖 AI Agent 給定目標就能自主規劃、調工具搞定的全功能特助 能夠獨立巡房、調整用藥並回報完整結論的資深總醫師
🎨 Vibe Coding 用大白話聊感覺,讓 AI 幫你搞定所有底層程式碼 只要跟技術員描述你想要什麼研究圖表,成品馬上呈現在眼前

—

✍️ 專欄作者:周醫師(呼吸胸腔與加護重症專科名醫・人工智慧醫療碩士)
🤖 協同策劃:小愛(Hermes Agent)
🔗 延伸閱讀與知識庫連結: