SOMPOホールディングス株式会社(以下、SOMPOホールディングス)は、AI活用の拡大に伴うリスクに対応するため、グループ全体でAIリスクガバナンスを整備し、AIモデルテストの標準化を進めています。 そこで、Dataikuを基盤に、デロイト トーマツの伴走支援を受けながら、AIモデルの精度や頑健性を継続的に検証する体制を構築。 AI活用をむやみに制限するのではなく、安全に活用を広げるためのガードレールとして、先進的な取り組みを導入しています。
グループ全体で標準化
開発、導入するAIに、統一基準でリスク評価とAIモデルテストを実施
多面的な検証を実現
正常系、異常系等のモデルテストを通して精度や頑健性を検証
説明責任と再現性を担保
どのデータからどう出力されたかを記録し、テストの再現性を確保
SOMPOグループの持株会社として、国内損害保険事業、海外保険事業、国内生命保険事業、介護事業などを束ねるSOMPOホールディングス。従来の保険によるリスク補償にとどまらず、少子高齢化に伴うさまざまな社会課題に対応するため、生命保険、介護、ヘルスケアの各機能をつなぐウェルビーイング領域を強化しているのが特徴です。2025年からは事業体制を「SOMPO P&C」と「SOMPOウェルビーイング」の2つのビジネス領域に再編。グループとして蓄積してきた顧客基盤、リスク管理ノウハウ、デジタル・データ・AI トランスフォーメーションを組み合わせた価値提供を進めています。
一方で懸念されていたのが、昨今のAIの利用拡大に伴うリスクの増大です。AIから生成されたアウトプットの公平性や透明性を確保し、継続的な運用体制を確立するためには、体系的なリスク評価とモデルテストが必須となります。
そこでSOMPOホールディングスは2025年3月、AIリスクガバナンスに係る規程類を策定。 グループ全体で開発、導入するAIシステムに対し、リスク評価とモデルの出力に対するテストを実施することをルール化し、統一された品質基準のもとで運用するというルールを定めました。
運用にあたっては、第三者評価の取得、AIモデルテストに関する知見や運用ノウハウの拡充、グループ会社間でのテスト能力の均一化など、多くの課題を乗り越える必要がありました。
グループ全体を対象としたAIリスクガバナンスの実践には、外部専門家の経験と知見の活用が非常に効果的です。 この判断のもと、SOMPOホールディングスはデロイト トーマツに伴走支援を依頼しました。
パートナー選定の軸は、「AI技術への理解」と、「損害保険を含む金融業界特有の規制や実務に関する知識」の大きく2つです。とくに、契約者の保険契約情報を扱うことから、業界知識の深さを重視しました。 そのうえで、AIモデルテストの項目設計から実際のテスト、改善提案まで一貫して対応できるデロイト トーマツのコンサルティング力を高く評価しました。
そして、デロイト トーマツからAIモデルテストの着実な実行を支えるプラットフォームとして提案されたのが「Dataiku」です。
Dataikuには、「AIの出力がどのデータから作られたかを追跡できる」「どのような加工が行われたか確認できる」「テスト処理の流れを記録できる」「テストのバージョン管理ができる」といった特徴があります。 これにより、テスト結果の説明責任を果たすとともに、テストそのものの再現性が担保されます。
グループ全体で長期に使い続けることを想定している以上、継続的なサービスが大前提となります。 加えて、グローバルで実績あるプラットフォームであることも、Dataiku選定の重要な判断材料となりました
柴田 裕輔 氏、SOMPOホールディングス株式会社 デジタル・データ戦略部 課長 兼 リスク統括部 テクノロジーリスク統括室 課長

AIモデルテストは、まずSOMPOグループ各社内のリスク評価を経て、実施要否を判断することから始まります。その後、対象システムの開発および運用を担うオーナー部門との協議を経て、デロイト トーマツがテスト設計を提案します。
こうしてDataiku上で実施されるAIモデルテストは、次の3つに大別されます。
1つ目は、AIからの出力の精度や根拠の妥当性を確認する「正常系」のテストです。保険分野における約款など、契約者と交わす主要文書を参照元として、AIの回答が適切な箇所に基づいているかどうかを確認します。比較対象として与えた正解との近さを類似度やカバー率といった指標を数値化し、可視化します。さらに、生成AIの出力を別の生成AIで要素分解して評価するといった手法も用いています。
2つ目は「異常系」、いわゆる頑健性のテストです。同じ意味を持った文章でも、表現を変えた際に回答が変化しないかどうかを確認します。例えば、お客さまや代理店さんからの照会に対して社員をサポートするようなAIシステムでは、入力表現の違いで回答内容が異なることはリスクになるため、慎重な検証が欠かせません。
3つ目は、お客様や代理店に対して直接AIが公開されるシステムを対象に、UIに対する疑似攻撃を行うテストです。デロイト トーマツがグローバルで蓄積してきた攻撃パターンを実際に流し込み、プロンプトインジェクションのような攻撃に対しても防御が機能するかを検証します。
テスト結果はDataiku上でダッシュボードとしてまとめられ、SOMPOグループ各社やデロイト トーマツに提供されます。プロジェクトごとに各指標の基準値を定め、達成割合を算出するとともに、根拠となったテストデータを詳細に確認することが可能です
佐藤 尚弥 氏、合同会社デロイト トーマツ デロイトアナリティクス&デジタルガバナンス シニアコンサルタント

仮に精度低下などの問題が検出された場合、初回のレポートでは対象システムのソースコードのどこに原因があるのかまで踏み込んだ指摘が行われます。あわせてデロイト トーマツは、具体的な改善案を提示します。
そして、オーナー部門がその内容を踏まえて改修を行った後、問題点が実際に改善したかどうかを再度モデルテストを実施し、確認します。
単にAIモデルテストを実施するだけでなく、課題解決や改善に向けた有効な施策をご提示できることが、私どもが提供する最大の価値であると自負しています。AIを禁止するだけなら簡単ですが、どうすれば活用できる水準まで持っていけるのか、お客様と一緒に考えることを重視しています
巻口 歩翔 氏、合同会社デロイト トーマツ デロイトアナリティクス&デジタルガバナンス シニアマネジャー

初回テストでは回答の精度が十分でなく、改善点が検出されるケースが多いものの、デロイト トーマツの助言を踏まえた改修後の再テストでは精度の向上が数字としても明確に表れています。この変化を客観的なデータとして確認できることが、AIシステムのリリース可否判断における重要な指標となっています。
万一、改善を重ねても精度が実用水準に届かない場合には、リリースの延期や中止も選択肢に入ります。そうした判断ができる体制自体が、AIモデルテストの意義にほかなりません。リリースが急がれる場面でも、AIリスクガバナンスの観点から客観的な判断材料をそろえ、必要に応じて経営層も交えた協議に持ち込む仕組みを整えています
竹内 宏明 氏、SOMPOホールディングス株式会社 リスク統括部 テクノロジーリスク統括室 特命部長 兼 室長

確かな手ごたえを得たSOMPOホールディングスは、このリスク評価およびAIモデルテストの枠組みを、すでに国内グループ会社全体に展開しています。
Dataikuについてもグループ共通で利用できる体制が整えられました。AIモデルテストに係る専門人材が少ないグループ会社であっても、SOMPOホールディングスがサポートする形で同水準のリスク評価およびテストを実施することが可能です。
今後はAIシステムのさらなる増加を見据え、社内にノウハウを蓄積すべき必要性も強く意識しています。定型的に繰り返すテストについては段階的に内製化を進める一方、新しいテクノロジーや高度な知見が要求される領域については、引き続きデロイト トーマツの伴走支援を受けるという役割分担を想定しています。
SOMPOグループの取り組みは非常に先進的です。第三者による検証をここまでしっかり行っている事例は、海外を含めてもまだ多くありません。ただし、AI利用に起因するインシデントは毎年増え続けており、今後もリスクを積極的に把握して適切に対策していくことで、AI活用を加速していくことができます。そうした場面で、私どもの知見をご活用いただければ幸いです
染谷 豊浩 氏、合同会社デロイト トーマツ Japan Trustworthy AI Lead パートナー

