A&A INSIGHTS
納品後のAIの品質をどう測り続けるか:評価セットの代わりに提案の採用率を見る
提案型のAIを納品したあと、品質を苦情が来たときだけ調べる運用から抜け出すための指標設計。Spellbookが採用率を「評価セットより良い」と述べた記述と、Supermetricsの対照を使い、採用・却下・編集の数え方と契約への書き方を示します。
Read in English
この記事の要点
提案型のAIを納品したあとの品質は、出した提案のうち何件が実際に採用されたかで継続的に測れます。ただし採用率は正しさではなく顧客の好みを測るため、品質の証拠ではなく「どこを調べるか」を決める指標として契約に書きます。
答え:採用率は「品質の証拠」ではなく「どこを調べるか」を決める指標
A&Aの考え方
返信案、下書き、修正案といった提案型のAIを納品したあとの品質は、出した提案のうち何件が実際に採用されたかで継続的に測れます。評価セットを作り直すより安く、毎日流れる本番の提案をそのまま使えます。ただし採用率が測っているのは正しさではありません。その顧客の好みです。だから採用率は顧客に提出する品質の証拠にはならず、どの区分を調べるかを決めるための指標として契約に書きます。
A&Aの考え方
この指標を契約に書くときに決めることは三つです。一つ、何を1件と数えるか。採用、却下、編集のどれを分母と分子に置くか。二つ、どの区分で見るか。全体の率ではなく、業務種別や担当者といった区分ごとに見ないと、調べる場所が絞れません。三つ、何を顧客に見せるか。率そのものを約束の数字として見せるのか、下がった区分を調べた報告だけを見せるのか。
A&Aの考え方
成果物の形を先に言います。品質レポートの雛形ではありません。「測る対象」「そこから分かること」「そこからは分からないこと」を一行ずつ並べた一枚の表です。三列目があることが肝で、採用率を単独で約束の数字にしてしまう事故は、この列を書かないところから起きます。
納品後に評価セットが回らなくなるのはなぜか
A&Aの考え方
検収は通った。商談のときに作った評価セットも、そのときは機能しました。問題はそのあとです。入力の傾向は変わり、担当者も変わり、モデルも上げ替えます。それに合わせて評価セットを作り直す工数は、一人から数人の受託では出てきません。結果として、品質を見る唯一の契機が苦情になります。
A&Aの考え方
苦情を契機にすると、気づくのが常に顧客より遅くなります。そして「苦情が来ていない」ことは品質の証拠として顧客に出せません。無事故は記録ではなく不在であり、不在は説明の材料になりません。だから必要なのは、作り直さなくても毎日入ってくる信号です。商談前に顧客の課題を持ち込んで比較できる評価セットを作る話は「AIサービスの商談デモに顧客の課題を持ち込む:比較できる評価セットの作り方」で扱っており、この記事が扱うのはその後、納品してから毎日流れる本番を使う測定です。
| 測る対象 | そこから分かること | そこからは分からないこと |
|---|---|---|
| 提案の採用率(採用件数 ÷ 提示件数) | その顧客の好みに合っているか | 正しさ。誤った提案の採用も1件として入る |
| 編集して使われた割合 | 方向は合っていて細部が合っていない区分 | 編集の重さ。一文字の修正と全面の書き直しが同じ1件になる |
| 却下の理由の内訳(任意記入) | 下がった原因の当たり | 記入されなかった却下。任意記入ほど母数が歪む |
| 同じ入力を複数回流したときの一貫性 | 毎回同じ判定が出るかどうか | 正しさ。毎回同じように間違っている場合も一貫性は高く出る |
| 区分ごとの採用率(業務種別・担当者別) | 次に目視で確認する場所 | 件数が少ない区分の実態。分母が小さいほど率は動いて見える |
| 苦情が来ていない期間の長さ | 何も報告されていないという事実のみ | 品質。無事故は不在であって記録ではない |
| 利用量と利用者数の伸び | 普及の度合い | 品質。普及の指標を品質の指標として読まない |
出典:Spellbookは採用率を「評価セットより良い」と述べている
出典に基づく事実
Anthropicが公開しているSpellbookの事例ページで、同社のCEO兼共同創業者であるScott Stevensonは測り方をこう述べています。「For every suggestion we provide, we measure how many actually get accepted by a user」。そして続けて「We think that's better than an eval, because it measures the subjective preferences of the user and whether we're meeting them」。評価セットより良いと考える理由として挙げられているのは、利用者の主観的な好みと、それに応えられているかを測れる点です。
出典に基づく事実
同ページには、この指標が成立する前提も書かれています。同社のClaudeを使ったレビュー用エージェントは月およそ53万件の契約書を処理し、そのうえで弁護士から月70万件を超えるチャットを受けているとあります。企業規模の欄は「Company size: Medium」で、2022年の提供開始から80か国5,000社に広がり、従業員は250名と書かれています。
出典に基づく事実
同ページは、チャットの回答に「citations a lawyer can check」を付けているとも書いています。レビュー基準の側も、各法務チームが自社の基準を明文化し、以降の契約書すべてに同社のエージェントがその基準を当てる仕組みだと説明されています。
出典に基づく事実
重要なのは、同ページが、同社が評価の仕組みも同時に持っていると書いている点です。同社は本番のモデルを「the oracle model in its evaluation pipeline」であるClaude Fable 5に対し、法務の専門家が検証した基準で採点しているとされています。どのモデルをどこに置くかを決める際も、候補をFableに対して測り、法務エンジニアと専門家による目視のレビューを行うと説明されています。採用率と評価の仕組みは、同じページに並んで書かれています。
A&Aの考え方
まず読み方を一つ。採用率は同社の評価を置き換えたのではなく、評価と並んで使われている、とA&Aは読みます。そのうえで、これらを並べると採用率が指標として働く条件が見えます。採用か却下かを利用者がその場で判断できること、判断の材料が提案に添えてあること、そして判断の回数が十分にあること。出典は「citations a lawyer can check」を採用の判断材料として説明しているわけではなく、確認可能性が採用率を意味のある信号にしているという読みはA&Aのものです。そしてA&Aの読みでは、三つ目の条件が受託の現場でいちばん欠けやすい。本記事が採用率を評価セットの代わりに置くのは、評価を維持する工数が出ない受託側の事情によるもので、出典の企業がそうしているからではありません。
出典:同社はモデル選定に、同じ入力を繰り返す一貫性の検査を使っている
出典に基づく事実
どのモデルをどこに置くかを決めるための検査として、同ページはこう記しています。「One check runs the same contract review, same prompt and contract ten times in a row and scores how consistently issues get flagged, because a lawyer only trusts a review they don't have to repeat」。同じ契約書と同じ指示で10回続けて走らせ、指摘がどれだけ一貫して出るかを採点する。理由として挙げられているのは、弁護士が信頼するのは繰り返さなくて済むレビューだからという点です。
出典に基づく事実
同ページは、レビュー面のモデル変更について、利用者の言葉を経緯として記しています。同社は今年、レビュー面をSonnet 4.6からOpus 4.6へ移しましたが、その前に顧客から事実上こう言われたとあります。「I feel like I have to run it three or four times to find everything」。全部見つけるには三、四回走らせないといけない気がする、という言い方です。なお同ページは、この変更が指標の代わりに決まったとは述べていません。
A&Aの考え方
A&Aの読みでは、この二つは同じことの表と裏です。「三、四回走らせないといけない気がする」という顧客の言葉は、一貫性が低いことの体感的な表現です。だから体感を数字に戻す判定として、同じ入力を10回流す検査が置かれている。採用率が好みを測るのに対し、こちらは安定を測っています。ただし出典はこの検査をモデル選定のための検査として記しており、納品後の継続測定として記していません。モデル選定の検査を納品後に転用し、二本立てで持つのはA&Aの設計です。なお「同じ入力を複数回走らせる」という仕掛け自体は、商談前の評価について「AIサービスの商談デモに顧客の課題を持ち込む:比較できる評価セットの作り方」で扱っています。この記事で新しいのは、それを納品後、却下が増えた区分に対して回す点です。
採用率が測っているのは好みで、正しさではない
A&Aの考え方
出典が採用率の長所として挙げているのは、利用者の主観的な好みを測れる点でした。これは裏返すと、正しさを測っていないという意味になります。利用者は誤った提案を採用することがあり、正しい提案を好みで却下することもあります。採用率はそのどちらも区別しません。
A&Aの考え方
だから顧客に提出する品質の証拠として採用率を使うと、約束できないものを約束することになります。採用率が90%でも、採用された中に誤りが混じっている可能性はそのまま残ります。逆に採用率が下がったとき、原因は品質の劣化かもしれないし、担当者が交代して好みが変わっただけかもしれません。
A&Aの考え方
それでも採用率には、評価セットにない取り柄があります。作り直さなくても毎日入ってくること、そしてその顧客固有の好みという、評価セットには原理的に書けないものを拾うことです。使いどころは、品質の証明ではなく、どの区分を調べに行くかの絞り込みです。採用率が下がった区分だけを人が見に行く。この順序なら、評価セットを作り直す工数をかけずに劣化の場所を絞れます。
A&Aの考え方
母数の扱いには注意が要ります。出典の企業は月およそ53万件の契約書と、月70万件を超えるチャットを扱う規模です。一人から数人の受託で、ある区分の提示が月に20件あるかどうかという状況では、同じ安定性は得られません。A&Aの注意として、件数が少ない区分は率に直さず、採用・却下・編集の実数のまま並べることを勧めます。率は、分母が小さいほど動いて見えます。
対照:主要指標に採用率を置かない会社は、品質を別の手段で担保している
出典に基づく事実
Anthropicが公開しているSupermetricsの事例ページは、冒頭に別の指標を掲げています。「Grew active users of its Claude connector 250% month over month on average since its February launch」。2月の提供開始以降、同社のClaudeコネクタの活動利用者が月平均250%伸びたという記述で、採用率ではなく利用者数の伸びです。
出典に基づく事実
同ページは、同社がモデルの検証のたびに正確性と一貫性を最優先したとも書いています。そのうえで品質の担保を別の手段で説明しています。データの返し方として「Serves normalized data from hundreds of marketing sources, with source and timestamp attached to every figure」とあり、すべての数値に出典と時刻が添えられるとされています。書き込み操作については、キャンペーンは停止状態で作られ、人が能動的に選ぶまで公開されないと説明されています。
出典に基づく事実
導入前の検証は顧客側が行ったと書かれています。同社の顧客である25名のノルウェーの代理店Layerのデジタルマーケティング戦略担当Morten Klevenは、クライアントへ展開する前に数週間をかけて出力を検証し、「I have not found a single hallucination or incorrect data point」と述べたとあります。結果として、手作業の表計算で10時間かかっていたクライアント向け報告が20分になり、そのうち17分は仕上がったデータをクライアントのGoogle Sheetへ移す作業だとも書かれています。
A&Aの考え方
A&Aの読みでは、この対照は優劣ではなく役割の違いです。Supermetricsのページが示しているのは、普及の指標を表に出しつつ、品質は「すべての数値に出典と時刻を添える」「人の承認を経るまで公開しない」という作りの側で担保し、導入前の確認は顧客自身の検証に委ねた、という構成です。納品前の検収と納品後の継続測定は別物で、顧客が数週間かけて検証したという話は、その後の毎日を測る仕組みの代わりにはなりません。両社の指標を優劣として比べないこと、そして250%という数字を品質の指標として読まないことが、ここでの要点です。
採用・却下・編集をどう数え、契約に何と書くか
A&Aの考え方
最初に決めるのは、編集して使われた場合の扱いです。採用に数えるか、却下に数えるか、第三の区分にするか。出典のどちらのページにも、この区別の仕方は書かれていません。各社の設計判断です。A&Aの勧めは第三の区分に置くことで、理由は、編集が多い区分と却下が多い区分では次にやることが違うからです。編集が多いなら方向は合っていて細部が合っていない。却下が多いなら方向そのものが合っていません。
A&Aの考え方
次に決めるのは、記録を誰が取るかです。利用者に理由を書かせる設計は、記入されない却下が増えて母数を歪めます。だから必須にするのは採用・却下・編集の三択だけにして、理由は任意記入に留めます。任意記入が集まらないことは想定の範囲で、集まらなくても三択の内訳だけで調べる場所は絞れます。
A&Aの考え方
契約に書くのは、数字の目標ではなく手続きです。「区分ごとの採用・却下・編集の件数を月次で記録する」「ある区分で却下が前月より増えた場合、その区分の提案を10件、受託側が目視で確認して報告する」「この記録は品質の保証ではなく、確認すべき箇所を特定するために用いる」。この三行なら、達成できない約束を含みません。採用率に目標値を置くと、達成のために提案を絞るという、品質と逆方向の最適化が起きます。
A&Aの考え方
下の表はA&Aの設計案です。行の切り方、第三の区分を置くこと、件数が少ない区分を率に直さないことは、どちらの出典にも書かれていません。表の三列目が本体で、二列目だけを読んで契約の数字に使うと、この記事が防ごうとしている誤読を自分で作ることになります。
架空例:月に届く提案が少ない受託で、どこまで測れるか
仮想例
ここからは架空の設定です。実在の顧客ではなく、A&Aが実施した事例でもありません。社員40名の住宅設備会社に、問い合わせメールへの返信案を作る仕組みを納品したとします。返信案は月に約180件出ており、担当者は3名。業務種別は見積依頼、納期確認、不具合申告の三つに分かれるとします。
仮想例
全体の採用率を一つの数字で出すと、月180件なので率としては読めます。しかし区分に割ると、不具合申告は月に20件前後です。この区分を率で読むと、1件の違いが5ポイント動きます。だから同じ設定で、全体は率、区分は実数で並べます。「不具合申告:採用11、編集6、却下3」。この形なら、前月との比較で動いたのがどの箱かが見えます。
仮想例
三か月目に、不具合申告の却下が3件から9件に増えたとします。ここで採用率の数字を顧客へ報告するのではなく、契約に書いた手続きを動かします。その区分の返信案10件を受託側が目視で確認する。確認すると、却下の多くは、保証期間の判定を誤った案だったとします(架空の設定です)。原因は品質の劣化ではなく、四月に保証規定が改定されていたことでした。
仮想例
同じ設定で、一貫性の確認も一度だけ入れます。却下が増えた区分の代表的な入力を1件選び、同じ指示で5回流して、毎回同じ判定が出るかを見る。毎回同じ誤り方をしていれば、原因は規定の記述の側にあります。回ごとに違う判定が出るなら、原因は指示の曖昧さの側です。どちらであるかで、直す場所が変わります(回数は架空の設定で、出典の10回をそのまま採ったものではありません)。
A&Aの考え方
この架空例に金額と削減時間を置かなかったのは意図的です。採用率の記録が直接変えるのは、劣化に気づく時点と、調べる範囲の広さだけです。解約率や追加受注がどう動くかは、この表からは出てきません。A&Aはこの設計と継続率・売上の関係を測定していません。
限界と、今日できる一歩
A&Aの考え方
限界を五つ書きます。一つ、両方のページはAnthropicが自社製品の採用例として公開した顧客事例で、独立した検証ではありません。掲げられた数値はベンダーと当該企業の自己申告です。本記事はそれらの数値を自社の見込みとして使っていません。
A&Aの考え方
二つ、採用率は正しさを測っていません。誤った提案の採用も、正しい提案の却下も、同じように1件として数えられます。だから顧客に提出する品質の証拠にはなりません。成果そのものの確かめ方は「AIが「完了」と言ったあと、業務の成果をどう確かめるか」で扱っています。
A&Aの考え方
三つ、規模が違います。出典の企業は月およそ53万件の契約書と月70万件を超えるチャットを扱い、企業規模の欄は「Company size: Medium」です。一人から数人の受託で同じ統計的な安定性は得られません。小さな母数を率として読む危険は、A&Aの注意として本文に置いています。
A&Aの考え方
四つ、提案型でないAIにはこの指標が当てはまりません。分類、抽出、転記のように、出力が採用か却下かで分かれない仕組みでは、採用率の定義そのものが作れません。その場合に使えるのは一貫性の側の判定だけです。
A&Aの考え方
五つ、採用・却下・編集の区別をどう記録するかは製品の作りに依存します。編集して使われた場合をどちらに数えるかは各社の設計判断で、出典のどちらのページにも記されていません。記録する仕組みがない製品では、まずその三択を残せるようにすることが最初の作業になります。
A&Aの考え方
今日できる一歩は一つです。直近に納品した提案型の仕組みを一つ選び、先月出した提案のうち何件が採用されたかを数えられるかを確かめること。数えられないなら、最初の作業は指標の設計ではなく、三択を残す記録の追加です。数えられるなら、業務種別で割って、件数が20件を下回る区分を実数のまま並べてください。顧客獲得から継続までの全体像は「AIネイティブGTMとは?一人・少人数で顧客獲得から継続まで回す実践ガイド」にあります。
提案型のAIを納品したあとの品質は、提案のうち何件が採用されたかで継続的に測れます。評価セットを作り直す工数をかけずに毎日入ってくること、そして評価セットには書けないその顧客固有の好みを拾うことが、この指標の取り柄です。ただし採用率は正しさを測っていないため、顧客に提出する品質の証拠にはなりません。使いどころは、どの区分を調べるかの絞り込みです。だから契約に書くのは目標値ではなく手続きで、却下が増えた区分を目視で確認して報告する、という形にします。採用・却下・編集の三択を記録し、件数が少ない区分は率に直さず実数のまま並べ、必要なら同じ入力を複数回流して一貫性を別に見ます。Spellbookのページが示しているのは、採用率を「評価セットより良い」と述べた同社の判断、その採用率が同社の評価の仕組みを置き換えずに並んで使われているという事実、そしてモデル選定の側に同じ入力を10回流して一貫性を採点する検査があるという事実です。Supermetricsのページが示しているのは、主要指標を普及に置きつつ、品質は出典と時刻の併記や人の承認という作りの側で担保しているという構成です。どちらもベンダーが公開した自己申告で、小規模事業での再現性を示していません。三択の設計、第三の区分、小さな母数を率にしないという判断はA&Aの提案で、効果は測定していません。
出典・編集情報
記事の調査で確認した一次資料です。資料の公開・更新時期と、調査時の確認日を分けて記載しています。
- Spellbook runs 530,000 contract reviews a month with Claude
Anthropic · no date shown on page
確認日 2026-10-06 - Supermetrics lets marketers manage ad campaigns from a conversation with Claude
Anthropic · no date shown on page
確認日 2026-10-06
AIを活用した記事制作
調査・執筆・翻訳・編集上の確認にAIを活用しています。資料に基づく事実、A&Aの考え方、仮想例は、それぞれ本文に明記しています。
編集上の確認日: 2026-10-06