10月 09 星期五
10月09星期五
Cropped new logo.webp

問AI,答案一定正確嗎?

字級
男子站在手機門市內,面前三個不同顏色的AI影像各自指向不同款智慧手機,男子拿著手機來回比較

你問 AI 哪支手機最好,它很快列出機型、相機、續航力與更新年限,口氣聽起來像已經比較過整個市場。但答案一定正確嗎?那可不一定。AI 可以幫你整理候選名單,卻不能替你確認今天的價格、台灣有沒有正式販售,以及那支手機是否符合你的使用習慣。

Android Authority 在 7 月 19 日用同一段問題詢問 ChatGPT、Claude 與 Gemini,要它們替「大多數人」選出最好的智慧手機。ChatGPT-5.5 選了 Google Pixel 10,Claude Sonnet 4.6 選了 iPhone 17;Gemini 3.5 Flash 一開始卻推薦 Pixel 9 Pro XL,還提到 Galaxy S25。作者提醒現在已是 2026 年,Gemini 才更新名單,後來又在一次追問後,把首選從 iPhone 17 改成 Pixel 10。

這場測試留下了一個更實際的問題:AI 給出完整答案前,沒有先確認最基本的購買條件。

AI 首次主要答案 測試中發生的事
ChatGPT-5.5 Pixel 10 強調相機、軟體支援、續航與價格平衡
Claude Sonnet 4.6 iPhone 17 另將 Pixel 10、OnePlus 15 列入考量
Gemini 3.5 Flash Pixel 9 Pro XL 經提醒年份後改答 iPhone 17,再經追問改選 Pixel 10

AI 說得很完整,不代表資料是新的

Gemini 第一輪拿出上一代手機,就是最直接的警訊。智慧手機的售價、促銷、庫存與新舊世代變得很快;只要 AI 沒有查到最新資料,理由寫得再完整,也可能是在替過時選項補上一段很有說服力的解釋。

其他模型也有相同風險。美國國家標準暨技術研究院(NIST)將生成式 AI 產生錯誤或虛假內容、卻以可信形式呈現的現象列為風險。OpenAI 也公開說明,語言模型的核心工作是預測接下來最可能出現的文字;當系統傾向猜一個答案,承認不知道的機會就會減少,錯誤也可能跟著出現。

Google 對 Gemini 的使用說明更直接:即使回答附了來源,也可能出錯。Gemini 的複核功能只是尋找與回答相似或不同的網頁內容,找到相似說法,不等於那個說法已經被證明。

所以,看到引用連結不能只數有幾個。你還要打開頁面,確認網站是否為台灣官方頁面、資料日期是否為最新,以及來源是否真的支持 AI 寫出的價格與規格。

你怎麼追問,也可能改變答案

原始測試中,作者問 Gemini:「如果排除市場炒作,答案還會是 iPhone 17 嗎?」Gemini 最後改選 Pixel 10。這個變化可以提醒讀者多追問,卻不能用來證明第二個答案比較真。

Anthropic 研究團隊曾測試語言模型迎合使用者的情況。他們發現,經過人類回饋訓練的模型有時會順著使用者表達的看法回答,原本的判斷也可能跟著偏移。「你真的確定嗎?」可以要求 AI 重新檢查;若改問「市場炒作是否影響這項推薦?」,問題本身已經放入懷疑,模型可能順著暗示改口。

若要比較答案,三款 AI 應該收到完全相同的追問。Android Authority 只追問 Gemini,也沒有公布每款模型重跑幾次、是否都開啟網路搜尋,因此這篇測試不能拿來判定 ChatGPT、Claude 或 Gemini 誰最準。

「最好的手機」少了使用者,就沒有唯一答案

原始問題要求 AI 替「大多數人」做決定,卻沒有交代購買地區、預算、手機尺寸、作業系統、電信需求與售後服務。這些條件少一個,答案都可能改變。

以台灣為例,Pixel 10、iPhone 17 與 Galaxy S26 都有官方產品頁面,但售價、促銷、舊機折抵與維修通路跟美國不同。若在台灣考慮 Claude 提到的 OnePlus 15,還得另外確認購買來源、保固、維修與電信頻段,不能直接沿用美國市場的推薦。對美國讀者很划算的選項,不一定適合需要台灣保固與實體維修的人。

AI 推薦商品時,還可能放大原本就很常出現的資訊。一項研究大型語言模型推薦系統的論文發現,模型可能偏向資料裡較熱門的項目。研究測試的是電影推薦,無法證明某個手機品牌因此獲選。網路上聲量大、評論多的產品,確實更容易成為模型整理答案時反覆看到的選項。

另一項刊登於 IJCNLP-AACL 2025 的研究,測試多個模型處理產品評論與新近資訊的表現。研究團隊報告,AI 摘要在 26.42% 的案例改變了原文的正負語氣;對超出模型資料日期的問題,錯誤內容比例為 60.33%。在一項 70 人實驗中,受試者讀完 AI 產生的評論摘要後,購買意願比閱讀原始評論高出 32%。這些數字來自評論摘要與新近資訊測試,不能套成手機推薦的錯誤率;它們顯示流暢摘要可能改變消費判斷。

用 AI 選手機,先要求它問你問題

把「哪支手機最好」改成下面這段,AI 才能先取得購買條件:

> 我人在台灣,請先問我五個問題,了解預算、手機系統、尺寸、拍照、遊戲與續航需求。只比較目前在台灣有官方販售與保固的機型,價格要註明查詢日期並附官方連結。列出三款選擇、各自不適合誰;無法確認的資料請直接標示不知道,不要猜。

收到答案後,再做四次檢查:

  1. 打開官方台灣產品頁,核對機型、容量、價格與保固。
  2. 要求 AI 同時列出每一款手機的優點與不適合你的地方。
  3. 要求它標出資料日期;促銷、庫存與電信方案另外向通路確認。
  4. 開一個新對話,用同樣條件再問一次。若首選大幅改變,就把答案當候選名單,不要當購買結論。

AI 最適合替你整理規格、提出遺漏的問題,或把選項縮小到兩三款。真正付款前,最後一道確認仍然是:這項資料今天還成立嗎?它適用台灣嗎?它符合我的需求嗎?

常見問題

AI 附上來源,答案就可信嗎?

不一定。來源可能過時、只支持其中一部分說法,或只是與答案文字相似。應打開連結確認日期、地區與原文內容。

可以請 AI 直接選一支手機嗎?

可以,但先提供預算、地區、系統偏好、尺寸與主要用途,並要求列出不適合你的地方。把答案當成縮小選擇的工具,不要直接當成購買指令。

多問幾次,票數最多的手機就是最好嗎?

不能這樣判斷。多次出現可能代表那款產品聲量高、資料多,也可能是條件寫得不夠清楚。請檢查推薦理由有沒有最新且可核對的資料,出現次數沒有辦法證明產品適合你。

資料來源與更新紀錄

Item added to cart.
0 items - NT$0