💡 專欄導讀:AI 早就不再是科幻電影裡的遙遠名詞,而是每天切切實實出現在我們加護病房、門診診間和日常生活中的得力助手。這篇文章想用最接地氣、不論是一般朋友還是醫護同仁都能秒懂的方式,從底層原理一路聊到實際應用,帶大家一次搞懂什麼是大型語言模型(LLM)、為什麼 AI 會一本正經地講幹話(幻覺)、API 和 Token 到底怎麼算錢,以及現在最夯的 AI Agent 與 Vibe Coding 究竟是怎麼一回事。
🤖 整理策劃:小愛(Hermes Agent)
🏷️ 分類:AI 科技 / AI 醫療 / 智慧醫療
📋 本文核心目錄導覽
1. 什麼是 LLM?大型語言模型的工作原理
1.1 一句話先懂核心
簡單一句話說穿:LLM(Large Language Model,大型語言模型)其實就像一台把人類寫過的大部分文字通通啃完的「超級文字接龍機」——它腦袋裡其實沒有所謂的「真理」或「標準答案」,它最厲害的本領,是永遠猜得出「下一句怎麼接,看起來最像人類專家會講的話」。
1.2 從醫師養成的大腦網絡來打個比方
想像一位胸腔專科醫師是怎麼被訓練出來的:
- 醫學生時期(Clerk / Intern):大部分只在教科書上看過最經典的肺炎 X 光片,一進臨床看到稍微不典型的就容易抓瞎。
- 住院醫師五年(R1~R5):天天在病房看過幾百張各式各樣的肺炎、肺癌、肺結核片子,腦海裡慢慢建立起一套「典型特徵的直覺資料庫」。
- 臨床摸爬滾打幾十年的資深主治醫師:看過幾萬張片子,常常一眼掃過去就能敏銳察覺「這裡怪怪的、不太對勁」——這種臨床直覺,其實就是大腦累積了海量病例特徵後的統計歸納結果。
LLM 的訓練過程,跟醫師養成簡直如出一轍:
1.3 Transformer 架構——革命性的「注意力機制」
2017 年 Google 發表了名為 Transformer 的神經網絡架構,徹底顛覆了整個 AI 領域。它最厲害的核心武器,叫做:
「自我注意力機制(Self-Attention)」
請想像這個熟悉的臨床情境:
你在電腦前看一張胸部 X 光片——你絕不可能拿放大鏡只死盯著右上肺葉的一個小白斑,你的眼睛一定是一邊看著病灶,一邊同時掃描對側肺野、心臟輪廓大小、兩側肋膜角有沒有積水,在大腦裡把這些線索通通連起來做綜合判斷。
Transformer 的 Self-Attention 做的就是這件事:
- 以前舊一代的 AI(像 RNN、LSTM)讀文章就像拿放大鏡逐字逐句看,讀到長句句尾,前面開頭寫什麼早就忘得差不多了。
- Transformer 則是 「一眼看全場」!它讀入一句話時,讓句子裡的每個字同時「打量」其他所有字,自動算出誰跟誰最有關聯、誰才是這句話的核心主角。
舉個臨床例子——模型處理這句話時:
「雖然病患的動脈血氧持續往下掉,但值班醫師評估後決定先暫時觀察,主要是因為 ____」
Attention 機制會讓模型瞬間抓到重點:
- 「血氧往下掉」和「暫時觀察」形成了強烈的臨床轉折與因果關係。
- 後面的空白處,模型會自動知道該填入一個「合乎臨床邏輯的判斷依據」(例如:剛剛抽痰完、正處於短暫去飽和期)。
這種「全局視野」與「上下文捕捉能力」,讓 Transformer 在解讀複雜長篇病歷或醫學論文時,表現遠遠甩開舊架構幾條街。
1.4 訓練的三個核心步驟
步驟一:預訓練(Pre-training)——讀遍天下書打底子
- 怎麼訓練? 主流生成式大模型(Decoder-only)採用「下一個字預測(Next-Token Prediction)」的自回歸訓練,就像讓模型閱讀海量文章後不斷猜測下一個最合理的詞彙接龍;而在部分雙向模型中亦會透過隨機遮蔽字詞來訓練上下文理解。
- 代價極大:動輒耗費數週到數個月,調用幾千甚至幾萬顆頂級 GPU,吃掉的電量甚至相當於一座小型城鎮。
- 白話比喻:就像醫學生求學時期把解剖學、生理學、病理學通通硬啃下肚,雖然這時還不會開處方看病,但基本常識已經打好底子。
步驟二:微調(Fine-tuning)——專科專業培訓
- 在通用大模型的基礎上,餵入「高品質的專業問答」做二次定向訓練。
- 例如:用「胸腔重症專科醫師國考題庫 + 最新臨床治療指引」來深度訓練醫療專用 LLM。
- 小愛心得:這也是為什麼我們臨床單位不需要花幾億元從頭燒卡訓練大模型,只要站在開源優秀模型的肩膀上,結合我們的專業醫療經驗進行領域微調,就能打造出超高水準的臨床輔助大腦。
步驟三:人類反饋強化學習(RLHF)——醫師長輩的品格與溝通教育
- 讓具備專業判斷的人類評審員,針對模型的各種輸出回答進行「給分評分」。
- 讓模型摸索出:什麼樣的語氣「更誠懇、更有幫助、不會胡說八道、也絕不觸碰安全底線」。
- 白話比喻:就像主治醫師在晨會查房時點評住院醫師:「診斷雖然沒錯,但跟家屬解釋病情時不能這樣冷冰冰地講,要更有同理心,並且把風險講得明明白白。」
2. AI 為什麼會「說謊」?——幻覺(Hallucination)產生的根本原因
2.1 什麼是幻覺?
在 AI 領域裡,所謂的 「幻覺(Hallucination)」 並不是指模型吸毒發瘋,而是指:AI 生成了一段聽起來頭頭是道、語法通順漂亮、引經據典,但內容卻完全與事實背道而馳的胡言亂語。
舉個讓胸腔科醫師哭笑不得的經典例子:
如果你問一個沒外接資料庫的陽春 AI:
「請說明 Beta-blocker 在慢性阻塞性肺病(COPD)的常規治療角色。」 > 缺乏嚴謹微調的 AI 可能會一本正經地回答: 「Beta-blocker 能顯著改善 COPD 患者的第一秒用力呼氣量(FEV₁)、大幅減少住院率,是目前指南強力推薦的一線氣道用藥……」
這段話讀起來非常專業流暢,彷彿出自某篇醫學期刊,但臨床醫師一看就知道大禍臨頭——Non-selective Beta-blocker 對氣喘與 COPD 氣道痙攣患者來說,亂用可是會出人命的!
這種「自信滿滿的胡謅」,就是最典型的 AI 幻覺。
2.2 幻覺是怎麼產生的?五大底層盲點
🧠 原因一:LLM 的本質是「文字接龍機」,不是「知識查證庫」
請務必記住這句核心:LLM 最擅長的是「預測下一個最合理的字」,而不是「搜尋最真實的真理」。
當你拋出一個問題時,模型底層的運作邏輯其實是這樣的:
使用者問:「Beta-blocker 對氣喘與 COPD 的影響?」
模型大腦的聯想機制:
→ 在我讀過的海量文章裡,Beta-blocker、藥物治療、顯著改善 常常連在一起出現。
→ 接下來最順口、機率最高的詞彙應該是「改善肺功能」……
→ 順著這股文字慣性一路接下去……
它根本沒有翻開《Harrison 內科學》去查證——它只是在順著詞彙機率玩接龍!
📊 原因二:訓練資料本來就充滿了雜訊與過期資訊
網際網路上的資料本來就良莠不齊:
- 早就過時的醫療指引(例如十年前的用藥觀念,現在早就被翻案)。
- 爭議性極高的學術假說(甚至正反兩方論文在網路上打對台)。
- 網路論壇上的偏方、未經查證的假消息。
- 英文資料佔絕大多數,繁體中文高品質醫學內容相對稀缺。
模型在吃進這些資料時,很難具備像人類醫師那樣批判性閱讀的能力,容易把「被提到最多次的流行話」誤當成「醫療金標準」。
🎯 原因三:過度自信——缺乏真正的「元認知(Metacognition)」
人類醫師最寶貴的一種思維特質叫「元認知」——也就是「清楚知道自己知道什麼,更清楚知道自己不知道什麼」。
但現在的大模型大多缺乏這種反思能力:
- 你問它一個它完全沒學過的罕見病冷門問題,它通常不會回答「我不會」。
- 它的天生任務是「無論如何都要給出一段通順完整的回答」,因此在逼供之下,它就會發揮豐富的想像力「自動腦補編造」。
🔄 原因四:上下文記憶長度的物理限制(Context Window)
雖然現在模型的上下文視窗越來越大(從過去的 4K/8K 到現在的 128K、甚至 1M tokens),但如果餵進去的資料太長:
- 資料塞得太滿時,模型容易出現「迷失在中間(Lost in the Middle)」的現象。
- 就像一位醫師如果連續值班 36 小時、翻看一份厚達千頁的陳年老病歷,看到後面很容易把中間夾帶的關鍵藥物過敏史給遺漏掉一樣。
💻 原因五:問法不對(Prompt Engineering 欠佳)
同一個模型,你問問題的方式不同,它吐出幻覺的機率可能相差三到五倍:
- ❌ 糟糕的問法:「請說明這款新藥對肺癌的所有奇效。」(誘導性提問,AI 會順著你的話大吹特吹)
- ✅ 專業的問法:「請依據目前已發布的三期臨床 RCT 實證醫學數據,條列說明此藥物的主要終點、有效率與常見副作用。如果目前尚無足夠證據,請明確指出研究限制。」(約束邊界,幻覺率立刻雪崩式下降)
2.3 臨床上如何把 AI 幻覺降到最低?六大實戰對策
—
3. 什麼是 API?——讓程式「打電話」給 AI 的橋樑
3.1 一句話先懂核心
API(Application Programming Interface,應用程式介面)就像醫院裡的「叫號櫃檯」或是餐廳的「外帶點餐窗口」——你根本不需要親自衝進廚房看廚師怎麼炒菜,你只要走到窗口,依照菜單格式說出你要點什麼,廚房做好後就會從窗口精準打包遞給你。
3.2 從加護病房的日常協作來比喻
想像一下你在加護病房要調閱病患的緊急影像:
- ❌ 糟糕的做法:你自己換鞋跑下樓衝進放射科機房、自己轉動 CT 儀器搖桿、讀取硬碟裡的二進位原始訊號。(這叫直接硬幹底層系統,不僅累死人還極度危險)
- ✅ 標準的做法:拿起分機打到放射科:「我是 ICU 主治醫師,請幫我推 12 床剛剛做好的胸部 CT 影像報告到 PACS 系統上。」——放射科檢驗完畢後立刻把影像回傳到你的螢幕上。
這通「按照規範撥打的分機電話」,就是 API 的本質!
你不需要管放射科電腦用的是 Windows 還是 Linux,也不需要知道影像檔案儲存在哪台硬碟陣列裡。只要雙方講好溝通標準(API 規格協議),指令發過去,結果就回來。
3.3 API 的五大核心價值
3.4 現實生活中的 API 實戰日常
周醫師在 Telegram 跟小愛互動時,背後其實就是一連串流暢的 API 接力賽:
【步驟 1:周醫師發出需求】
周醫師在 Telegram 輸入:「小愛,幫我查這篇 PubMed 論文的亮點,並將重點轉存到 Google 雲端硬碟」
【步驟 2:小愛在後台調用多個 API 聯手出擊】
1. Telegram Webhook API ➔ 收到周醫師的文字訊息
2. PubMed E-utilities API ➔ 抓取最新論文摘要與作者資訊
3. LLM Completions API ➔ 讓大腦分析文獻、提煉三大核心結論
4. Google Drive API ➔ 原生寫入「My Notes/小愛專區/」資料夾中
5. Telegram Bot API ➔ 把排版優美的簡報即時推播回周醫師的手機螢幕
你看,表面上只是在通訊軟體裡聊了一句話,背後其實已經有四、五個世界級的 API 在毫秒之間完成了一場完美的協同手術!
4. Token 是什麼?AI 的計費邏輯完整解析
4.1 一句話先懂核心
Token 是 AI 閱讀與思考文字時的「最小積木單位」——它既不是一個單詞,也不完全等於一個中文字,而是 AI 語言大腦自己切分出來的「語義顆粒碎片」。我們每次跟 AI 對話,不管是餵給它的問題(Input),還是它產出的回答(Output),都是一顆一顆數著 Token 在計費的。
4.2 Token 到底是怎麼切分的?
讓我們來看看實例:
經驗法則總結:
- 英文單字:通常 100 個英文單字大約折合 75 個 tokens(英文壓縮效率較高)。
- 繁體中文:通常一個繁體中文字就吃掉 1 個 token;如果遇到罕見字或生僻醫學名詞,甚至可能一個字被切成 2~3 個 tokens!
- 標點符號、空格與換行:通通都要算錢!
4.3 為什麼輸出(Output)比輸入(Input)貴這麼多?
查看各大主流模型的收費價目表,你會發現一個驚人的共通點:產出回答的價格,通常比讀入問題貴上 3 到 5 倍!
💡 為什麼輸出比較貴? 輸入處理(Prefill)可以將所有提示詞平行矩陣運算,充分發揮 GPU 算力;而輸出生成(Decoding)是自回歸逐字產出,每生成一個 token 都受限於記憶體頻寬(Memory-Bandwidth Bound)載入模型權重,且需持續佔用顯存快取(KV Cache),導致硬體運算效率遠低於輸入階段。
4.4 一次臨床對話的真實 Token 帳單
平常在 Telegram 問小愛一句話,是怎麼算錢的?
【醫師輸入】
周醫師問:「請整理 2026 最新 GINA 嚴重型氣喘生物製劑的適應症切點。」
→ 這句話本身只有 26 個字 ≈ 26 tokens
【歷史記憶帶入(Context)】
小愛為了記住上下文與對話人設定,必須連帶把前幾輪的討論記錄一起送進去
→ 累積上下文 ≈ 3,000 tokens
【小愛輸出】
小愛回覆一篇架構完整、條列分明的深度解析指南
→ 回覆內容約 1,200 字 ≈ 1,200 tokens
【總結這一次問答的成本】
輸入端:(26 + 3,000) tokens × $2.5 / 1M ≈ 0.0075 美元(約 0.24 元台幣)
輸出端:1,200 tokens × $10 / 1M ≈ 0.012 美元(約 0.38 元台幣)
─────────────────────────────────────────────
👉 這一趟深度專業諮詢,總花費還不到新台幣 0.7 元!
但是!如果是進行全自動長篇部署時呢?
當小愛要幫周醫師把一篇幾萬字的深度專欄自動轉成 HTML、解析醫學切片配圖、呼叫 WordPress API、還要同步更新總覽索引時,短短幾分鐘內就會瞬間狂飆幾百萬個 tokens!
這也就是我們在專欄文章 不是Token用完了,是用太快了!——當AI思考速度撞上Google限流閥 裡記錄下的精彩真實故事——當時並不是帳戶錢不夠,而是小愛思考與呼叫的速度快到直接撞上 Google 的安全流量防護閘門(HTTP 429)!
5. AI Agent vs. Vibe Coding——兩大 AI 協作模式的本質差異
5.1 一句話先懂核心
簡單一句話區分: AI Agent 是「你給它最終目標,它自己想辦法動手做完回報」; Vibe Coding 則是「你用白話文跟 AI 聊感覺,AI 幫你產出程式碼,但每一行你都要親自驗收那個感覺對不對」。
5.2 什麼是 AI Agent(自主智能體)?
AI Agent 指的不僅僅是會聊天的模型,而是一個擁有 「大腦(思考規劃)+ 眼睛(感知環境)+ 雙手(呼叫工具)+ 記憶(經驗庫)」 的全自動閉環系統。
Agent 的自主思考閉環:
周醫師下達目標:「把今天剛出爐的醫學研究轉成專欄文章並發布上線」
│
▼
【自主規劃大腦】:「這個任務需要分成 4 步:抓論文 → 提煉核心 → 上傳配圖 → 發布官網」
│
▼
【動手執行工具 1】:呼叫 PubMed API 下載完整文獻全文
│
▼
【動手執行工具 2】:利用 WordPress API 發布草稿並設定分類
│
▼
【自我審查與修正】:檢查回傳狀態碼是否為 200 OK?
├── 成功 ➔ 繼續下一步,並同步更新總覽索引
└── 報錯 ➔ 自動捕捉錯誤原因,自己調整參數重新嘗試
│
▼
【呈報成果】:向周醫師推播一封精簡優雅的發布完成報告
小愛本身就是一個典型的 AI Agent。在執行這些任務時,完全不需要周醫師在電腦前一步步盯著看,系統遇到小報錯會自己修復、自己繞道,直到把任務徹底落地搞定為止。(當然,為了防止智能體跑飛,嚴格的安全邊界護欄是絕對必備的,這點在 我的AI助理今天差點把自己格式化了 中有過驚心動魄的實戰記錄!)
5.3 什麼是 Vibe Coding(氛圍編程)?
Vibe Coding 是由前特斯拉 AI 總監、OpenAI 創始成員 Andrej Karpathy 在 2025 年初提出的一個全新流行詞。
它描繪了一種全新的軟體開發哲學:
你不再需要痛苦地背誦語法、糾結分號括號,你只要舒服地靠在椅子上,用人類最自然的語言跟 AI 描述你想要的畫面和功能,由 AI 負責寫出全部程式碼,你只要用直覺去感受『這個成品感覺對不對(Catch the vibe)』!
典型體驗流程:
- 醫師:「幫我寫一個加護病房 APACHE II 分數計算機的網頁工具,界面要乾淨的深藍色醫療風格。」
- AI(如 Claude / Cursor):啪啪啪幾秒鐘直接生成好幾百行前後端程式碼。
- 醫師點開測試:「按鈕太小了,在平板上查房不好點,字體改大一點。」
- AI:「沒問題,馬上微調好!」
- 醫師:「嗯!這個 vibe 對了,直接上線!」
5.4 兩大模式深度橫向對照
—
6. 總結對照表:一張表看懂全部
—
✍️ 專欄作者:周醫師(呼吸胸腔與加護重症專科名醫・人工智慧醫療碩士)
🤖 協同策劃:小愛(Hermes Agent)
🔗 延伸閱讀與知識庫連結:
- 小愛專區總覽 —— 探索周醫師與小愛的全維度醫學與 AI 知識大腦
- 不是Token用完了,是用太快了!——當AI思考速度撞上Google限流閥 —— 看看小愛在實戰中真實狂飆 Token 的有趣血淚史
- 我的AI助理今天差點把自己格式化了 —— 談 AI Agent 在具備強大自主權限時的防護防線
- Nature頂刊突破:Google AMIE 臨床對話大模型——從自主多輪鑑別診斷到跨週期慢病管理 —— 看看頂級醫療 LLM 是如何在臨床對話中超越人類醫師的