最先端AIでも、法律の専門タスクでは最高62点——ベンチマーク調査が示す、法務AIの現在地

2026年10月2日

SHARE

XFacebook

契約書の読み込み、要約、条文の調べもの。ChatGPTやClaudeに任せると、驚くほど速く、それらしい答えが返ってきます。

では、その答えを、そのまま法務の意思決定に使ってよいのでしょうか。

今回は、海外で相次いでいる法務AIのベンチマーク調査と、MOLTONが上場企業の法務担当者206名に実施した調査の両方から、汎用AIの「得意」と「苦手」を整理してみます。

汎用AIは本当に便利です

米国のVals AIが2025年に公表した法律リサーチの評価では、ChatGPTの正答率は80%でした。比較対象の弁護士は71%です。法務特化のAI製品も79~81%に並び、AIは弁護士を約7ポイント上回りました。

法律事務所向けAIを手がけるPercipientの評価(LawVal 2.0)でも、文書レビューでは10モデル中9モデルが89~97点。契約書の修正案づくりでも、上位モデルは87~89点に届いています。

「大量の文書を読んで整理する」「決まった型に沿って直す」。こうした作業は、もう人間の出る幕が小さくなりつつあります。

MOLTONの調査でも、上場企業の法務部門の89.8%がAIを導入しており、経営層の71%、一般社員の49%が「作業が早くなった」と回答しています。便利さは、現場でも実感されているわけです。

それでも、専門的な「分析」になると点数が落ちる

ところが、同じPercipientの評価で、雇用法の分析タスクだけは様子が違います。

最高得点はClaude Opus 4.7とGPT 5.5 Thinkingの61.5点(100点満点)。文書レビューで90点台を出していた同じモデルが、法的な論点の整理と結論づけになると、6割ちょっとにとどまりました。しかもモデル間の点差は37ポイントまで開いています。

Vals AIの評価でも、傾向は同じです。

  • 複数の州にまたがる質問では、正答率が単一州の質問より平均11ポイント下がった
  • 「深い解釈」や「微妙な判断」が必要な問いでは、およそ3分の1の分野で弁護士がAIを上回った
  • 判例どうしの区別や、矛盾する権威の調整は、人間に分があった

さらに気になるのが、もっともらしい間違いです。Percipientは、点数の低かったモデルが「法的な正確さ」の項目で約半分の点を失ったと報告しています。文章はきれいなのに、根拠が違う。採点した弁護士が言う「表面的な法律らしさ」と「本当の法的判断」の差が、難しい課題ほどはっきり出ています。

なお、AI企業HAQQの評価(自社サービスが上位という前提つきの調査ですが)では、3,000件のAI回答のうち24%が、引用した法律の内容と主張が食い違っていたとされています。数字の大小はともかく、「もっともらしいが根拠が違う」が一定の割合で起きるという点は、どの調査でも共通しています。

なぜ、専門領域になると精度が落ちるのか

理由は、大きく3つに整理できます。

1つ目は、「知っていること」の限界です。汎用AIが学習しているのは、主に公開された情報です。法改正や最新の判例は日々動きますし、有料データベースの中身は見えません。MOLTONの調査でも、AIを使いこなせない理由として「法改正・最新情報が反映されていない」が14.1%ありました。

2つ目は、「自社のこと」を知らないことです。契約の許容ラインも、過去の交渉経緯も、業界の慣行も、AIには見えません。同じ調査で「自社・業界固有のルールを考慮してくれない」は15%。プロンプトを工夫すれば緩和できますが、毎回ゼロから背景を説明するのは、現場にとって小さくない負担です。

3つ目は、「分かりません」と言いにくいことです。AIは、空欄を埋めるのが得意です。根拠が足りなくても、それらしい文章で埋めてしまいます。「AIが誤情報を出すのが怖い」(15%)という現場の不安は、ここに直結しています。

つまり、AIの賢さが足りないというより、法務の判断に必要な材料(最新の法令、自社の基準、責任の所在)が、汎用AIの手元にそろっていないのです。

この差は、満足度にも表れています。MOLTONの調査では、専門特化ツールの満足度は8割台から9割超。汎用AI3製品(ChatGPT・Claude・Gemini)は71~76%にとどまりました(専門特化ツールは回答数が少なく、参考値を含みます)。

結局、どう付き合うのがよいのか

ここまでの話を、実務の言葉に直してみます。

AIは、下書き・整理・洗い出しを、人の何倍も速くこなします。一方で、最後の「この条件で会社として受けてよいか」の判断には、最新の知識、自社の文脈、そして責任を負う人が要ります。

だから、答えはAIか人かの二択ではなく、どこまでをAIに任せ、どこから人が見るかの線引きになります。

  • 読む、洗い出す、たたき台をつくる。ここはAIに任せる
  • その出力を、専門知識をもつ人が確認して判断する
  • 判断の基準は、使うたびに残して育てていく

社内でこの体制を組めるなら、それが一番です。ただ、MOLTONの調査では、採用が計画通りに進んでいないと感じている法務担当者は、経営層で約6割、一般社員では約9割でした。人手が足りないなかで、AIの出力チェックまで抱えると、確認作業そのものが負担になります。専門家のチェックだけ外部の力を借りる、という選択肢も、現実的な手のひとつだと思います。

おわりに

汎用AIは、法務の強力な道具です。ただ、専門的な分析で使うなら、点数の落ちる領域があること、そして落ち方が「もっともらしい間違い」であることを、前提にしておく必要があります。

道具の限界を知ったうえで、AIに任せる範囲と、人が見る範囲を決める。その線引きが、法務AI活用の出発点になるはずです。

MOLTONでは、法務に特化したAIと、専門家によるチェックを組み合わせた「クラウドリーガル」を提供しています。自社の契約書でAIの得意・不得意を確かめたい方は、7日間の無料トライアルもご利用ください。

▼ 無料トライアル(7日間・登録1分)

https://www.molton.inc/ai-bpo/#trial-form

出典

SHARE

XFacebook