課題
自社プロダクトにAIによる法令チェック機能を載せたい。しかし「精度が出るのか」が分からないまま開発に投資はできない——AI機能の検証と実装判断が課題でした。
やったこと
評価セット約100件を設計し、AIの判定結果を弁護士の監修ループで検証。精度を測定可能な形にしたうえで、Go/No-Goの判断材料を揃えました。
難しかったこと
白黒のつく事例だけでは、実務を測れない。 明らかに問題のある事例ばかりを集めれば数字は上がりますが、現場で迷うのは判断が割れる事例です。評価セットにその領域を厚く入れた結果、監修でラベル自体が見直され、精度の数字も動きました。評価セットを版で管理し、ラベルが変わるたびに全件を測り直す形にしています。
弁護士の時間が、いちばんの律速。 監修に出せば出すほど検証は確かになりますが、そのぶん全体が止まります。依頼するのはラベルの確認と観点出しに絞り、事例の作成・集計・測り直しは当社側で回す分担にしました。監修の戻りを反映してから、もう一度全件を通す順序も固定しています。
効きそうな打ち手が、測ると効かない。 上位のモデルに替える、判定を二段構えにする——精度を上げる定石として挙がった案は、同じ評価セットで測るといずれも優位が出ませんでした。改善案は足す前に同じ条件で測る順序を守り、構成を増やさないまま本実装へ渡せる形に確定しました。
納品物
評価セット・全件の出力一覧・精度の検証結果と、Go判定。価格・期間を確定して実施しました。
その後
Go判定を受けて、本実装フェーズへ。プロダクトへの組み込みとライセンス提供に向けて進行中です。
同じ型が効く業務
「AI機能を載せたいが、精度が出るか分からないまま開発に投資できない」という詰まり方は、法務に限りません。有資格者や熟練者が最後に目視で確かめている業務——請求内容の点検、申請書類の審査、検査結果の判定——にも、同じ順序が使えます。
この案件では、精度が出るかを会議で議論するより、少数でも評価セットを先に作って測ったほうが、投資判断が早く固まりました。正解を持っている人の時間は、事例づくりではなくラベルの確認と観点出しに使う。当社の経験では、この配分が検証の速さを決めています。
AI機能を載せたいとは思っていても、精度が出るのかが分からないまま開発に投資はできませんでした。先に評価セットを作って測れる形にしてもらえたので、判断材料が揃ってから進められました。評価の枠組みごと手元に残るので、社内への説明もしやすかったです。
— ご担当者 お客様の声
