Skip to content
Cloud AI エンジニア入門ガイド
Go back

11. ChatGPTの限界とリスク

実務で使うなら、この章をいちばん丁寧に読んでください。限界を知らずに使うと、便利さがそのまま事故になります。なぜ間違うのかを仕組みと研究知見の両面から説明して、実務での確認手順に落とします。

この章の全体像として、ハルシネーション、事実誤り以外のリスク、慎重に扱う場面、重要度に応じた検証の4つを番号順に並べ、読み終えると任せてよい作業と人が確かめる作業を分けられるようになることを示した図

シリーズ目次前章: 10. ChatGPTとAPIの違い次章: 12. ChatGPTのプライバシーと安全な利用

Table of contents

Open Table of contents

この章のねらい

ハルシネーション

ハルシネーション(hallucination、幻覚) は、モデルが事実に反する内容をもっともらしい体裁で生成してしまう現象です。存在しない論文、実在しないURL、間違った日付や数値。このあたりが典型です。

厄介なのは、誤った出力ほど自信ありげに見えること。文体は正しい回答とまったく同じなので、内容を知らない読み手には区別できません。

原因の2層

統計的な生成、評価方法の偏り、不確実性の表明が罰される構造がハルシネーションを生む関係の図

原因は2層に分けると見通しがよくなります。

第1層: 生成の仕組みそのもの

第2章で見たとおり、モデルはもっともらしい続きを生成します。学習データに十分な情報がない事柄でも、文としてありそうな形は作れてしまう。知らないという状態と、うろ覚えという状態を、内部で区別していないからです。

第2層: 学習と評価のインセンティブ

OpenAIらの研究「Why Language Models Hallucinate」(Kalai, Nachum, Vempala, Zhang, 2025)は、この現象を難しい試験問題に直面した学生にたとえているそうです。分からない問題でも空欄にせず何か書けば当たるかもしれない。一方、多くの採点方式では分かりませんは0点です。

論文の主張の要点は次のとおりです。

つまり、自信を持って答えることが訓練を通じて有利になってきた。構造的な理由があるわけです。裏を返せば、利用者の側で分からないと答えてよいと明示的に許可することには意味があります(第4章のテンプレート参照)。

推論モデルや検索の併用で誤りは減りますが、ゼロにはなりません。モデルが不確実なときに回答を控えればハルシネーションを避けられることもありますが、出力を無条件に正しいものとして扱わないでください。

事実誤り以外のリスク

リスク内容実務での現れ方
バイアス学習データに含まれる社会的な偏りを反映する職業や属性に関する記述の偏り、特定の立場に寄った要約
追従性利用者の主張に同調しやすい誤った仮説を肯定される、批判的な検討が省かれる
著作権・知的財産既存表現に類似した出力が生じ得る生成文・生成画像をそのまま公開して権利問題になる
情報の非対称出力の体裁が良いほど信頼してしまう長いレポートを検証せず採用する
過度の依存自分で考える機会が減る判断の根拠を説明できなくなる
責任の所在AIの出力に責任は取れない誤った出力に基づく意思決定の責任は利用者側にある

6つを並べると、いずれも出力の正しさとは別の軸で効いてくることが分かります。

バイアス、追従性、著作権・知的財産、情報の非対称、過度の依存、責任の所在という6つのリスクを、それぞれ実務での現れ方つきで3列2段に並べた図

追従性への実践的な対処を挙げます。

私の案に賛成する必要はありません。
この案の弱点を3つ、根拠とともに挙げてください。
そのうえで、反対の立場から最も強い反論を書いてください。

自分の意見を先に言わずに質問するのも効きます。この方針は正しいですか、ではなく、この状況で考えられる選択肢を3つ挙げてそれぞれの長所と短所を示してください、と聞く。これだけで同調圧力が働きにくくなります。

使ってはいけない場面・慎重に扱う場面

領域注意点
医療・健康診断や治療方針の判断には使えない。情報整理や質問の準備までにとどめる
法務法令の条文・判例は必ず原典で確認する。地域と改正時期で内容が変わる
金融・税務制度は頻繁に改正される。具体的な数値は公的資料で確認する
人事評価・採用個人の評価に用いるとバイアスと公平性の問題が生じる
安全に関わる判断出力を最終判断の根拠にしない

これらの領域で使ってはいけない、のではありません。最終判断を委ねてはいけないのです。論点整理、専門家に聞くべき質問の準備、用語の学習には十分使えます。

領域ごとの注意点と、それでも残る有用な使い方を並べておきます。

医療・健康、法務、金融・税務、人事・採用、安全に関わる判断という5領域の注意点を並べ、それでも論点整理や質問の準備、用語の学習には有用であることを示した図

重要度に応じた検証

すべての出力を同じ厳密さで検証するのは無理です。重要度で段階を分けてください。

出力の重要度に応じて検証の厳しさを変える三段階の図

段階対象検証方法
個人メモ、アイデア出し、自分だけが読む文章読んで違和感がないか確認する程度
社内共有資料、下書き、学習用の説明数値・固有名詞・日付を出典で確認。専門用語の定義を確かめる
社外公開、契約・法令に関わる文書、意思決定の根拠全記述を一次資料で照合。別の情報源で再確認。専門家のレビュー

実務で効くのは次の5つです。

  1. 数値・日付・固有名詞を1つずつ出典で確認する(最も間違いやすい)
  2. 条件と例外が落ちていないか原文と照合する
  3. URLは実際に開く(存在しないURLが生成されることがある)
  4. 否定形の反転がないか確認する(「できない」が「できる」に変わっていないか)
  5. 自分が知っている分野なら、その部分の正確さを他分野の推定に使わない(一部が正しくても全体が正しいとは限らない)

最後の項目が厄介です。自分の専門分野の記述が正確だったからといって、専門外の記述の信頼性は上がりません。むしろ専門分野の正確さが、専門外の誤りへの警戒を緩めてしまうことがあります。

使ってよい作業の見分け方

目安は2つです。

この2軸で考えると、下書きを作らせて人が確認する形がいちばん安全で効率的です。逆に、確認なしで外部へ出る経路を作ると、事故ったときに大きく響きます。

2軸を掛け合わせると、作業ごとの扱い方が4通りに整理できます。

誤りに気づけるかと、誤ったとき戻せるかという2軸で4象限をつくり、そのまま任せてよい、確認してから出す、検証してから使う、経路そのものを作らないという対応を割り当てた図

要点

参考資料


シリーズ目次前章: 10. ChatGPTとAPIの違い次章: 12. ChatGPTのプライバシーと安全な利用


Share this post:

Previous Post
12. ChatGPTのプライバシーと安全な利用
Next Post
10. ChatGPTとAPIの違い