期待と実態の乖離:PoC止まりが多発する構造
生成AIの業務適用において、社内データを外部知識として参照させるRAG(検索拡張生成)は、最も汎用的な解決策として注目を集めてきました。社内ドキュメントを取り込めば、従業員や顧客のあらゆる疑問に答える自律的な知能ポータルが即座に完成するかのような言説も少なくありませんでした。しかし、実際のエンタープライズ導入現場においては、約7割から8割のプロジェクトがPoC(概念実証)の段階で頓挫するか、本番公開から1年以内に形骸化して利用停止に追い込まれています。
ベンダーや導入企業が公表する工数削減や高いROIといった数値の多くは、API利用料と単純計算された作業時間短縮を掛け合わせた理論上の試算にとどまり、運用保守に伴う実質的なコストが除外されているケースが大半です。RAGが投資対効果として成立し、自立した業務システムとして持続している事例は、現実には極めて限定された条件下の領域にとどまっています。
システムを赤字化させる隠れコストと精度の積算崩壊
RAGが経済的にペイしない最大の要因は、初期開発費ではなく、運用フェーズで発生する 継続的な運用保守コスト(TCO) と、確率的モデル特有の精度劣化にあります。
多くの失敗事例では、データが存在することと、それがAIにとって機械可読(Machine-readable)であることの差異が見過ごされています。社内に蓄積された文書の多くは版管理が曖昧で、古い情報と最新情報が混在し、図表の崩れやOCR誤認識による欠損を抱えています。これらを高精度に検索可能な状態へ整えるには、業務を熟知した専門人材による手作業のクレンジングが不可欠です。しかし、高単価な人材をデータ整備に長期間拘束すれば、その人件費だけでRAGの投資回収期間は非現実的な年数に跳ね上がります。このデータ整備費用を事前に計算に入れない外部不経済が、運用破綻の引き金となります。
さらに、システム工学的な観点における精度の積算崩壊も現場の信頼を失わせる決定打となります。RAGの総合的な正解率は、以下の要素の乗算によって決定されます。
- 検索精度(適切なドキュメントのヒット率)
- 抽出精度(該当箇所の正確な読み取り率)
- 生成忠実度(ハルシネーションを起こさない要約率)
仮に各ステップが90%という高い精度を達成していたとしても、掛け合わせれば総合的な正解率は約73%に低下します。4回に1回は不正確な案内をするシステムは、契約や法務、厳密な手続きを伴う業務では実用に耐えません。結果として人間による二重チェックが常態化し、自動化によるコスト削減効果は相殺されます。
実用化と投資回収が成立している実例の共通点
一方で、RAGが誇大広告ではなく実際に経済的合理性を持って稼働し続けている領域も存在します。それらの事例には明確な共通項が存在します。
スウェーデンのフィンテック大手Klarnaの事例では、カスタマーサポートにおける定型的な問い合わせ(注文確認や返品手順など)を自動化し、大幅な効率化を達成しました。しかし、同社も例外的なトラブルや複雑な金融判断まで全自動化しようとした局面では顧客体験の悪化に直面し、最終的に「正常系の定型案内はAI、例外系は人間」というハイブリッド体制へと軌道修正を行っています。これは高度な推論による問題解決というよりも、構造が明確な既存FAQへユーザーを誘導する 高機能な案内インターフェース として割り切ることで成果を維持した例といえます。
また、モルガン・スタンレーにおける社内アナリスト向けのリサーチ検索や、製造業・プラント保守におけるマニュアル検索の成功事例では、以下の共通構造が見られます。
- 利用者が業務のプロフェッショナルであること:AIの出力に多少の粗やハルシネーションがあっても、専門家自身が自らのドメイン知識で正誤を即座に判断できます。
- データがAI導入前から厳格に整備されていたこと:法規制や品質管理基準への対応のため、AIの都合とは無関係に、原本管理と構造化が元から徹底されていました。
- 削減される作業時間自体の単価が極めて高いこと:高給のアナリストや専門技術者の調査工数が削減されるため、システム維持費を大幅に上回るリターンが生じます。
これらの現場においてRAGに求められているのは、完璧な文章の自動生成ではなく、確実な一次情報への ショートカット機能 です。
適用判断の境界条件と代替手段の検討
実務においてRAGの導入や提案を検討する場合、その適用可能性は極めて慎重に判断されるべきです。RAGが真に成立するためには、以下の独立した条件を同時に満たす必要があります。
- 対象となるデータが、既存の業務都合ですでに高精度に管理・維持されていること
- 利用者が誤答を即座に検知できるリテラシーを持ち、誤答の被害が限定的であること
- 削減される時間が高単価であり、データ保守と運用の総コストを上回ること
- 従来の全文検索やUI改善では達成できない柔軟性が真に求められていること
これらの条件は積集合(AND条件)として機能するため、すべてを満たす領域は業務全体から見ればごく僅かです。多くの現場で生じている課題の本質は、検索システムの性能不足ではなく、情報自体の整理不足や命名規則の不在といった情報管理の機能不全にあります。
単に正しい文書へ到達させたいのであれば全文検索エンジンの強化やタグ付けで十分であり、手続きの迷いを解消したいのであれば画面設計の改善やルールベースの分岐設計の方が、誤答リスクのない確実な解となります。RAGは厳密性を犠牲にして非構造化データの探索柔軟性を得る技術であり、決定論的な正確性を最優先する実務領域への適用には、構造的なトレードオフの不一致が存在します。
参考
- Klarna laid off 700 humans for AI. Now it's rehiring.
- Klarna (Customer Service) - Killed by LLM
- Klarna's AI: 700 Agents, Then a Rehire | Paul Okhrem
- Klarna Replaced 700 Agents With AI and a Year Later They Were Rehiring Humans - Kaamfu
- My RAG Journey: 3 Real Projects, Lessons Learned, and What Actually Worked : r/Rag
- Enterprise RAG Cost 2026: $15K to $150K Breakdown
- Your RAG Pipeline Is Probably Useless. Here’s a Better Alternative - KDnuggets
- What Is RAG? Real-World Use Cases, How It Works, and How to Implement It | by Reenbit | Medium