你每天用 AI 問問題,但你知道它有多常在說謊嗎?

有個工程師朋友上個月跟我說,他用 ChatGPT 查一個 Python 套件的 API 用法,照著生成的程式碼貼上去,跑了兩個小時才發現那個 method 根本不存在——是 AI 自己「發明」的。他說:「最可怕的是,它講得超有把握,連參數名稱都給得很完整。」
這不是極端案例。這大概是 2026 年用生成式 AI 最普遍的日常體驗之一。
幻覺輸出:AI 說錯還說得很自信
白話講,幻覺(hallucination)就是 AI 生成了聽起來合理、但實際上錯誤甚至不存在的內容。引用不存在的研究論文、捏造公司財報數字、寫出從來沒有過的法律條文——這些都是真實發生過的案例。
2023 年美國有位律師用 ChatGPT 準備法庭文件,裡面引用了六個假判例,全部是 AI 自己編的,案號、法院名稱、判決摘要一應俱全,結果在法庭上當場露餡,被法官罰款。這件事當時鬧很大,但更值得注意的是:那位律師完全沒有懷疑過。
問題在於,現在的語言模型生成的是「統計上最可能接在前面那句話後面的文字」,不是「查詢資料庫之後輸出的正確答案」。你可以把它想成一個讀過幾兆字文本的人,在沒有 Google 可以查的情況下憑記憶回答你——有時候答對,有時候答錯,但語氣永遠一樣篤定。
過期資訊:訓練截止日之後的世界,AI 不知道
這個問題比幻覺更容易被忽略。大部分語言模型都有一個訓練資料的截止日(training cutoff),截止日之後發生的事情,它就不知道了。
問題是很多人用的時候根本不記得這件事。你去問 AI「現在某個框架的最新版本是多少」,它可能會給你一個六個月前的版本號,但它不會主動告訴你「這可能是過期資訊」。更麻煩的是,就算有些模型接了即時搜尋,它拼接搜尋結果和自身知識的方式也不見得可靠,有時候搜尋到的片段反而跟生成的內容產生矛盾。
Perplexity vs OpenAI 的使用情境比較這篇我之前有提到,Perplexity 因為搜尋優先的架構,在時效性這塊確實比純聊天型模型有優勢,但也不是零風險——它引用的來源本身就可能有問題。
假引用和來源混淆:讓人誤以為「有根據」
幻覺的一個特別危險的子集,是假引用。AI 可以生成非常像真實論文格式的引用:作者姓名、期刊名稱、年份、卷號、頁碼,每一個細節都存在,但組合在一起的那篇論文根本沒有人寫過。
這件事在醫療、法律、學術這幾個領域的殺傷力特別高。你想像一下:有人在做健康決策,查了某個療法的效果,AI 給出了「根據 2024 年某某期刊的研究,這個方法有 78% 的有效率」——如果那篇研究是虛構的,影響的是真實的人體健康。
你有沒有遇過這種情況?
我猜你或你身邊的人大概都有過類似經驗:AI 給的答案「感覺不對」,去查才發現確實有誤,但你不一定每次都有去查。
這才是核心問題所在。我們傾向於相信流暢、有條理、語氣肯定的內容,而生成式 AI 幾乎每次都符合這三個條件。人腦的懷疑機制有個弱點:如果對方說話的方式夠自信,我們會下意識降低戒心。
如果 AI 真的只聽你的話,這個世界會變成什麼樣子?那篇我討論過 AI 對齊的問題,但資訊風險其實是另一個維度的對齊挑戰——不是 AI 做壞事,而是 AI 說錯話,而且說得很好聽。
這些風險在哪些情境下最容易踩到
整理一下幾個特別高風險的使用場景:
- 問法規、條文、合約細節:AI 可能混合不同地區的法律或引用已修訂的條文
- 查藥物劑量或醫療建議:錯誤的後果不可逆
- 引用學術論文:假引用問題在這裡最集中
- 查詢產品版本或 API 文件:訓練截止日問題最明顯
- 問即時市場或財務數據:AI 在金融業的應用邊界這篇說過,AI 拿來整理已知資訊還行,但拿來做即時決策的依據就需要非常謹慎
帶走一個想法
我不是要你停止用 AI——那不實際,也沒必要。但有一個習慣值得養成:把 AI 的輸出當成草稿,不是結論。
它說「根據研究」,你問它研究在哪;它給你引用,你去確認引用是否真實存在;它說某個函式的用法,你去翻一下官方文件。多走這幾步,AI 帶來的效率提升才是真的,而不是把錯誤處理的時間轉移到更後面、更難收拾的地方。
流暢的語言和正確的資訊,是兩件事。現在這個階段,把這兩件事分開來看,是用 AI 最基本的自我保護。
分享這篇


