ホーム導入事例 / 評価セット約100件・弁護士監修で精度を検証——Go判定から本実装へ

法務領域のSaaS企業SaaS・IT

評価セット約100件・​弁護士監修で​精度を​検証——​Go判定から​本実装へ

SaaSプロダクトに載せる法令チェックAI機能を、評価セット約100件・弁護士監修ループ・Go/No-Go判定の枠組みで検証。価格を着手前に確定して実施し、本実装フェーズへ進みました。

評価セット約100件・弁護士監修ループでGo判定。2〜5週で実施

書類の上に置かれた万年筆
写真はイメージです
業種
SaaS・IT
規模
中堅〜エンタープライズ
支援内容
  • 評価セット約100件の設計・作成(判断が割れる事例を厚めに)
  • 弁護士監修によるラベル確認と観点出しのループ運用
  • 全件の精度測定とGo/No-Goの判断材料の整理
  • 本実装へ引き継げる出力仕様と手順の文書化
担当
村山 悠太(代表・設計から実装まで)

課題

自社プロダクトにAIによる法令チェック機能を載せたい。しかし「精度が出るのか」が分からないまま開発に投資はできない——AI機能の検証と実装判断が課題でした。

やった​こと

評価セット約100件を設計し、AIの判定結果を弁護士の監修ループで検証。精度を測定可能な形にしたうえで、Go/No-Goの判断材料を揃えました。

難しかった​こと

白黒のつく事例だけでは、実務を測れない。 明らかに問題のある事例ばかりを集めれば数字は上がりますが、現場で迷うのは判断が割れる事例です。評価セットにその領域を厚く入れた結果、監修でラベル自体が見直され、精度の数字も動きました。評価セットを版で管理し、ラベルが変わるたびに全件を測り直す形にしています。

弁護士の時間が、いちばんの律速。 監修に出せば出すほど検証は確かになりますが、そのぶん全体が止まります。依頼するのはラベルの確認と観点出しに絞り、事例の作成・集計・測り直しは当社側で回す分担にしました。監修の戻りを反映してから、もう一度全件を通す順序も固定しています。

効きそうな打ち手が、測ると効かない。 上位のモデルに替える、判定を二段構えにする——精度を上げる定石として挙がった案は、同じ評価セットで測るといずれも優位が出ませんでした。改善案は足す前に同じ条件で測る順序を守り、構成を増やさないまま本実装へ渡せる形に確定しました。

納品物

評価セット・全件の出力一覧・精度の検証結果と、Go判定。価格・期間を確定して実施しました。

その​後

Go判定を受けて、本実装フェーズへ。プロダクトへの組み込みとライセンス提供に向けて進行中です。

同じ型が​効く​業務

「AI機能を載せたいが、精度が出るか分からないまま開発に投資できない」という詰まり方は、法務に限りません。有資格者や熟練者が最後に目視で確かめている業務——請求内容の点検、申請書類の審査、検査結果の判定——にも、同じ順序が使えます。

この案件では、精度が出るかを会議で議論するより、少数でも評価セットを先に作って測ったほうが、投資判断が早く固まりました。正解を持っている人の時間は、事例づくりではなくラベルの確認と観点出しに使う。当社の経験では、この配分が検証の速さを決めています。

AI機能を載せたいとは思っていても、精度が出るのかが分からないまま開発に投資はできませんでした。先に評価セットを作って測れる形にしてもらえたので、判断材料が揃ってから進められました。評価の枠組みごと手元に残るので、社内への説明もしやすかったです。

— ご担当者 お客様の声