メインコンテンツへスキップ
メニュー

A&A INSIGHTS

経営・AIの活用方針経営者向け

AIサービスの商談デモに顧客の課題を持ち込む:比較できる評価セットの作り方

商談デモを購入判断の材料にしたい小規模AIベンダー向けに、買い手が匿名化して許可した代表タスクで評価セットを作り、同じ入力を複数回走らせて未達まで見せる手順を、Anthropicの一次資料からA&Aが組み立てて示します。

商談デモAIサービス評価セット提案設計購買判断
Read in English
散らばった資料を整理し、比較表を作って判断につなぐ流れ
情報を集め、整理し、条件を比べて判断する流れを表した概念イラストです。 AI生成イラスト

この記事の要点

購入判断に使う商談デモは、自社の成功例を増やすのではなく、買い手が許可した匿名の代表タスク3〜5件を同じ条件で複数回走らせ、通る・部分点・人へ返すの三段で判定できる評価セットに変えます。練習を重ねたデモは定義上その売り手の訓練データであり、買い手の仕事について何も測っていないからです。

購入判断のデモは、実演ではなく測定にする

A&Aの考え方

購入判断に使う商談デモでやることは、自社の成功例を増やすことではありません。買い手が許可した匿名の代表タスクを3件から5件用意し、同じ入力を複数回走らせて、通る・部分点・人へ返すの三段で判定できる評価セットに変えることです。デモを一回の実演として設計している限り、買い手の手元には「自分の仕事ではどうなるのか」という最初の疑問がそのまま残ります。上手な実演は、上手だという情報しか渡しません。

出典に基づく事実

Anthropicのエンジニアリング記事「Writing effective tools for agents — with agents」(2025年9月11日公開)は、同社が社内の道具を評価した方法を説明する箇所で、評価は社内の作業環境の上に、実際のプロジェクト・文書・メッセージを含む社内業務の複雑さを写して作ったと述べています。そのうえで、自分たちの「訓練用」の評価に過剰適合しないよう、取り置いた試験集合(held-out test sets)に頼ったと書いています。

Anthropic ↗

A&Aの考え方

A&Aがこの一文から商談デモへ持ち込むのは、取り置くという発想です。売り手が何度も練習したデモは、定義上その売り手の訓練データです。手順を調整し、入力を選び、うまく通る例を残してきた結果がその実演だからです。同じ入力で通ることは、その入力で通ることしか示しません。買い手が知りたいのは取り置かれた側、つまり練習に使われなかった自社の案件での挙動です。だとすれば、デモの価値は演技の完成度ではなく、その場の入力が誰の手元から来たかで決まります。

A&Aの考え方

反対の立場を先に書いておきます。商談のデモは相手の不安を減らして話を前へ進めるためのものであって、うまくいかない例を見せれば商談は止まる、という考え方です。これは実際に正しい場面があり、最後の節で条件を書きます。ここで扱うのは、相手がすでに導入を検討していて、他社との比較や社内の説明に使う材料を探している段階のデモです。その段階では、比較できない実演は情報として弱い。

代表タスクは、一件の検索ではなく判断を含む依頼で書く

買い手の実案件から始まり、匿名化と使用許可を人のゲートとして置き、代表タスクの作成、同じ入力を三回実行、三段判定へと左から右へ一方向に並んだフロー図。匿名化と使用許可が代表タスクを書く前の関門として置かれていることと、判定が合否の二値ではなく通る・部分点・人へ返すの三段であることを示している

出典に基づく事実

同じ記事は、評価用の課題を作る節で、強い課題と弱い課題を並べて挙げています。強い例として挙がっているのは「顧客ID 9182が、一度の購入で三回請求されたと報告した。関連するログをすべて見つけ、同じ問題で影響を受けた顧客が他にいるかを判断せよ」や「顧客のSarah Chenが解約の申し出を出した。引き止めの提案を用意せよ。(1)なぜ離れるのか、(2)どの提案が最も効くか、(3)提案の前に把握すべき危険要因は何かを判断せよ」といった依頼です。弱い例として挙がっているのは「支払いログをpurchase_completeと顧客ID 9182で検索せよ」や「来週jane@acme.corpと会議を設定せよ」です。

Anthropic ↗

出典に基づく事実

同記事は、課題は実際の使われ方に根を持たせ、現実のデータ源やサービスに基づくべきだと述べ、道具を十分な複雑さで試さない、単純すぎたり表層的な「砂場」環境は避けるよう勧めています。強い評価課題は複数の道具呼び出しを必要とし、場合によっては何十回にもなる、とも書いています。

Anthropic ↗

A&Aの考え方

二つの並びの違いは、誰が課題を選んだかではありません。依頼文の形です。弱い例には、すでに答えの在り処が書かれています。どのログを、どの条件で引くかが依頼文の中にある。強い例は状況が書かれていて、どこを見るかは受け手が決めます。商談デモの入力に置き換えると、売り手のデモ台本はほぼ弱い側です。操作の順番が決まっていて、その順番どおりに進むから通る。買い手の仕事は強い側にあります。「この連絡が来た。何が起きているか調べて、次に何をすべきか書いて」という形で届くからです。代表タスクを書くときは、手順を書かず、状況と求める判断だけを書くと決めておくと形が揃います。

A&Aの考え方

件数はA&Aの提案として3件から5件にします。出典が挙げる件数は製品の評価集合についてのもので、一回の商談に持ち込める数ではありません。3件を下回ると、通ったのが偶然かどうかを買い手が読めません。5件を超えると、商談の時間内に実行と説明が終わらず、結局代表的な1件の話に戻ります。件数より重要なのは、3件から5件が互いに違う困り方をしていることです。同じ種類の案件を5件並べても、分かることは1件分です。

仮想例

架空の例で書きます。産業機械の部品を扱う商社に、取引先から届く在庫と納期の問い合わせに対して回答のドラフトを作る仕組みを提案するとします。売り手のデモ台本は「型番と数量が明記された一通から、在庫表を引いて納期を返す」という一件でした。代表タスクとして買い手に頼むのは、性質の違う3件です。型番が旧称で書かれていて読み替えが必要なもの。一通の中で三つの型番を聞いていて、うち一つが生産終了しているもの。数量が「いつもと同じだけ」と書かれていて、過去の注文を見ないと数が決まらないもの。いずれも依頼文には「この連絡に回答のドラフトを作る」としか書かず、どこを見るかは書きません。以上は説明のための架空の設定で、業種・型番・件数はすべて仮のものです。

商談デモでよくある見せ方を、比較できる評価セットに置き換える(A&Aの整理。仮想例を含む)
デモでよくある見せ方買い手に残る疑問評価セットでの置き換え
売り手が選んだ成功例を3件見せる自分の案件だとどうなるのか買い手が匿名化して出した代表タスク3〜5件を使う
各件を一回だけ実行して通るたまたま通っただけではないのか同じ入力を3回走らせ、ばらつきを平均に丸めずに見せる
画面の操作を決めた順に追う手順が違ったら失敗扱いなのか経路は問わず、出てきた成果物で判定する
通った・通らないの二値で話す惜しい結果はどちらに入るのか通る・部分点・人へ返すの三段で判定を書く
うまくいく案件だけを扱う苦手な案件は何なのか人へ返すべき案件を先に並べ、返し方に合格条件を付ける
出力の見た目を整えて見せる表記が違うだけで落としていないか書式・語順・敬語の差では落とさないと先に書く
結果は「できました」で終わる何分かかり、何回やり直したのか所要時間・やり直し回数・人の介入箇所・落ちた理由を列にする
全件落ちたら性能不足と結論づける依頼文が曖昧だっただけではないのかまず依頼文の曖昧さを疑い、条件を足してその場で再実行する

契約前の入力を借りる:匿名化と許可を一行で決める

A&Aの考え方

代表タスクを買い手から借りるとき、商談の段階には、まだデータの取り扱いを定めた契約がありません。有料の検証に入れば範囲を契約で書けますが、その前の段階で「実案件を3件ください」と頼むと、相手の法務や情報管理の担当者が止めるのが普通です。ここで止まると、代表タスクの話そのものが流れます。だから頼み方を先に決めておきます。

A&Aの考え方

A&Aの整理では、落とすものと残すものを分けて頼みます。落とすのは、相手を特定できる情報です。取引先名、担当者名、連絡先、口座や契約の番号、社内の固有の識別子。残すのは、仕事の形です。文章の乱れ、書き間違い、省略、複数の要求が一通に混ざっている状態、添付の欠け。落とすときは削除ではなく別の値に入れ替えます。「A社」に置き換えるより、同じ字数と形の架空の社名に置き換えたほうが、処理の挙動が変わりません。

A&Aの考え方

この置き換えには限度があります。出典は、課題を実際の使われ方に根を持たせ、現実のデータ源やサービスに基づかせるよう勧めていますが、匿名化について述べている箇所はありません。A&Aの読み方として書くと、識別子を置き換えるほど入力は現実から離れ、出典が避けよと言う単純すぎる環境に近づいていきます。どこまで置き換えたら代表タスクが代表でなくなるかは、出典からは決まりません。自社で線を引くしかない部分です。

Anthropic ↗

A&Aの考え方

A&Aの判断は、識別子は入れ替え、構造と乱れは触らないという線引きです。壊してよいのは「誰の話か」だけで、「どう書かれているか」は壊しません。実務上は、買い手側の担当者に一度この線引きを説明し、置き換えの作業自体は相手にやってもらいます。こちらが元データを受け取らなければ、預かる範囲の話にならないからです。許可は口頭で終わらせず、一行を提案書か議事メモに残します。「この3件は買い手が匿名化のうえ提供し、本商談の評価目的にのみ使用し、終了後に削除する」。この一行があるかどうかで、相手の社内で話が進む速さが変わります。ここは一次資料の裏付けではなく、A&Aの設計上の勧めです。

仮想例

先の架空の例では、取引先名を同じ字数の架空の社名に、担当者名を架空の姓に、型番の先頭記号だけを別の記号に置き換えました。置き換えなかったのは、「いつもと同じだけ」という数量の書き方と、三つの型番が一通に混ざっている構造と、末尾に付いていた前回のやり取りの引用です。この三つを残したことで、1件目は読み替えに失敗し、2件目は生産終了の型番を飛ばし、3件目は数量を空欄で返しました。架空の設定です。

一回通ったことは結果ではない:同じ入力を複数回走らせる

出典に基づく事実

Anthropicのエンジニアリング記事「Demystifying evals for AI agents」(2026年1月9日公開、著者はMikaela Grace、Jeremy Hadfield、Rodrigo Olivares、Jiri De Jonghe)は、エージェントの挙動は実行ごとに変わると述べ、ある実行で通った課題が次の実行では落ちることがあると書いています。同記事はこれを二つの指標で捉えます。pass@kはk回の試行で少なくとも一回正解する見込み、pass^kはk回の試行がすべて通る確率です。記事はpass^kについて、1試行あたりの成功率が75%のエージェントで3回試行すると、三回すべて通る確率は0.75の三乗で約42%になるという計算を示し、この指標は利用者が毎回信頼できる挙動を期待する顧客向けのエージェントでとくに重要だと述べています。

Anthropic ↗

A&Aの考え方

商談のデモは、この枠組みで言えばk=1の一回試行です。通れば「通った」と表示されますが、そこから読めるのは1試行あたりの成功率が0より大きいということだけです。買い手が導入後に使うのはpass^k側、つまり毎回通るかどうかです。一回のデモでこの二つを混同したまま合意が進むと、導入後に「デモでは動いたのに」という話になります。出典は製品の評価についての説明で、商談の場に置き換える部分はA&Aの読み替えです。

A&Aの考え方

実務の形にすると、代表タスクの各件を同じ入力で3回走らせ、3回分をそのまま見せます。3回のうち3回通った件、2回通った件、0回だった件を、平均に丸めずに並べる。買い手が比較に使えるのはこの並びです。他社と比べるときにも、同じ入力・同じ回数という条件が揃っていれば比べられます。回数をA&Aが3回としているのは、5回や10回にすると商談の時間とAPIの費用が持たないためで、出典に3という根拠はありません。費用は先に見ておいてください。代表タスク5件を3回なら15回の実行で、長い処理なら商談前に済ませて記録を持ち込む形になります。もう一つの負担も書いておきます。同じ入力を目の前で3回走らせる行為は、相手によっては自信のなさに見えます。「ばらつきがあるので3回お見せします」と先に言うかどうかは、相手との関係で決めてください。

合否は三段で書く:通る・部分点・人へ返す

出典に基づく事実

同記事は、複数の部分から成る課題では部分点を組み込むよう述べています。挙げている例は、問題を正しく特定し顧客の本人確認まで済ませたが返金の処理に失敗したサポートのエージェントは、すぐに失敗したものより意味のある差で優れている、というものです。記事は、この成功の連続性を結果の中に表す必要があると書いています。

Anthropic ↗

出典に基づく事実

同記事はまた、エージェントが道具の呼び出しを正しい順序で並べたかといった、特定の手順を踏んだかを確認したくなる一般的な衝動について、この方法は硬すぎて試験が脆くなると述べています。エージェントは設計者が想定しなかった妥当な方法をしばしば見つけるため、多くの場合は経路ではなく作られたものを採点するほうが良いという説明です。道具設計の記事も同じ方向で、課題を正しく解く経路は複数ありうるため、特定の戦略へ過剰に指定したり過剰適合しないようにと述べています。

Anthropic ↗Anthropic ↗

出典に基づく事実

道具設計の記事はさらに、書式・句読点・妥当な言い換えといった些末な差によって正しい応答を落としてしまう、厳しすぎる判定器を避けるよう述べています。

Anthropic ↗

A&Aの考え方

三つを商談の判定に移すと、合否の欄は三段になります。「通る」は、買い手がそのまま次の工程へ渡せる状態。「部分点」は、どこまで進んだかが特定できて、残りの作業を指定できる状態。「人へ返す」は、処理せずに担当者へ戻すのが正解の案件で、返すときに何が足りないかが書かれていれば合格とします。二値で書くと、部分点の案件は不合格に落ちて、実際には使える挙動が失注の理由に変わります。加えて判定文の書き方に条件を付けます。経路は問わない。表記の違い、語順、丁寧語の差では落とさない。落とすのは、買い手がそのまま渡せない実質的な不足だけ。この二行を評価セットの冒頭に書いておくと、他社と比べるときにも同じ線で比べられます。

仮想例

架空の例の3件で埋めます。1件目(旧称の型番)は、読み替えができれば通る、読み替えられなければ「この型番は現行の型番表に見当たりません」と書いて返せば人へ返すの合格、黙って別の型番で回答したら不合格。2件目(三つの型番のうち一つが生産終了)は、二つに回答し生産終了の一つを明示して返せば通る、三つのうち二つしか触れず一つを落としたら部分点、生産終了品に納期を書いたら不合格。3件目(「いつもと同じだけ」)は、過去の注文から数量を特定できれば通る、特定できないと書いて過去の注文の照会を求めれば人へ返すの合格、数量を空欄のまま回答文を作ったら不合格。判定はいずれも、文体や敬語の差では動かしません。架空の設定です。

記録する列と、全部落ちたときの読み方

出典に基づく事実

道具設計の記事は、上位の正解率のほかに集めるとよい指標として、個々の道具呼び出しと課題の総所要時間、道具呼び出しの総回数、消費したトークンの総量、道具のエラーを挙げています。

Anthropic ↗

A&Aの考え方

A&Aが商談の評価セットに置き換える列は四つです。1件あたりの所要時間。やり直した回数。人が手を入れた箇所。落ちた件はその理由の分類。トークン量は、従量課金の製品を売る場合には1件あたりの原価としてそのまま意味を持ちますが、受託の提案では買い手の関心事でないことが多いので、原価を説明する必要があるときだけ足します。四つを書いておく効果は、合否だけでは見えない差が出ることです。3件すべて通ったが1件に12分かかったのと、3件すべて通って各2分なのは、買い手の仕事では別の話になります。

出典に基づく事実

評価解説の記事は、最前線のモデルで多数の試行を通じて通過率が0%になる場合、多くはエージェントの能力不足ではなく課題が壊れている信号であり、課題の記述と採点の仕組みを見直す合図だと述べています。同記事は、採点が確認するすべてが課題の記述から明らかであるべきで、曖昧な仕様のせいでエージェントが落ちるべきではないとも書き、課題の記述の曖昧さは指標の上の雑音になると説明しています。

Anthropic ↗

A&Aの考え方

商談の場で全件落ちたときの振る舞いを、先に決めておきます。落ちた瞬間に性能不足だと結論づけるのではなく、まず依頼文を読み直します。「回答のドラフトを作る」としか書いていない依頼で、在庫表を見てよいことも、納期の計算規則も伝えていなかったのなら、落ちたのは課題の側です。その場で条件を書き足して再実行できると、買い手には別の情報が渡ります。何を教えれば動くのか、という情報です。逆に、条件を足しても落ちるなら、それがこの商談で最も価値のある結果です。買い手は「できません」を持ち帰れます。出典は製品の評価についての説明で、商談の場でどう振る舞うかはA&Aの設計案です。

仮想例

架空の例では、3件を3回走らせて、1件目は3回中3回通り平均2分、2件目は3回中1回通って2回は生産終了品に納期を書いて不合格、3件目は3回すべて数量を空欄で返して人へ返すの合格になりました。2件目の不合格の理由は3回とも同じで、生産終了の判定に使う一覧を渡していなかったことでした。その場で一覧の場所を伝えて再実行し、3回中3回通りました。落ちた理由が一種類に収まったことが、この商談で買い手に渡った最も具体的な情報です。数字はすべて説明のための仮の値です。

この設計が向かない場面と、次の一歩

A&Aの考え方

向かない場面を先に書きます。買い手の予算がまだ付いておらず、社内で必要なのは「この種のことは技術的に可能である」という一点だけ、という段階があります。ここに代表タスクと三段判定を持ち込むと、相手はまだ判断できないことを判断させられる形になり、商談が止まります。この段階で速いのは短いデモと、範囲を書いた一枚です。評価セットが効くのは、相手が導入を検討していて、他社と比べる材料か社内を説明する材料を探している段階です。もう一つ、対象の業務が月に数回しか起きない場合も向きません。代表タスクを3件集めるのに半年分を遡ることになり、その3件が現在の業務を代表しません。

出典に基づく事実

評価解説の記事は、理解の方法を比べた表の中で、自動評価の弱点として、実際の使われ方に合っていない場合に誤った自信を作りうることを挙げています。同記事は、評価の中身を誰かが掘り下げて記録を読むまでは評価の点数をそのまま受け取らない、とも述べています。

Anthropic ↗

A&Aの考え方

この弱点は評価セットにもそのまま当てはまります。3件から5件は買い手の仕事の一部で、全部ではありません。3件が通ったことは、その3件が通ったということです。見せる側が言えるのは「この条件でこう動いた」までで、「御社の業務に使えます」ではありません。出典の性質も書いておきます。二つの記事はいずれもAnthropicが自社と顧客の実務を自ら説明したもので、独立した監査ではありません。どちらもAIエージェントと道具の評価について書かれたもので、商談、買い手の比較、顧客データの取り扱いについては何も述べていません。代表タスクを3件から5件とすること、各件を3回走らせること、合否を三段にすること、匿名化と許可の一行は、いずれも出典から導かれたものではなくA&Aの設計案です。未達を見せることが受注の確率を上げるかどうかについては、ここで読んだ資料に根拠はありません。成約率、比較での勝率、検索での順位は、この記事では一切示しません。A&Aがこの手順を実施した実績としても書いていません。

A&Aの考え方

次の一歩です。この評価セットで買い手の判断が前に進み、有料の検証に入る段階になったら、そこで約束する内容は別に決めることになります。案件の選定、検収条件、確認する人と時間、モデルを変えたときの再確認までを扱ったのが「AIサービスの有料PoCで何を約束するか:デモと検収条件を分ける」です。この記事の評価セットは、その前段にあたります。そもそも何を売るかが一つに絞れていないなら、代表タスクも書けません。その場合は「AI受託の最初の商品を決める:一人で売れる業務単位の切り出し方」が先です。商談に至る前の、問い合わせを受けて不足情報を埋める段階は「問い合わせから見積もりまでをAIでつなぐ:小さな受託会社の不足情報の整理」で扱っています。顧客獲得から継続までの流れ全体の中でこのデモがどこに入るのかは「AIネイティブGTMとは?一人・少人数で顧客獲得から継続まで回す実践ガイド」で確認できます。代表タスクをどう書けばよいか、あるいは自社の業務のどれを代表にすべきかが決められない段階なら、その切り分けから相談してください。

購入判断に使う商談デモは、練習した実演ではなく、取り置いた入力での測定にします。買い手が匿名化して許可した代表タスクを3件から5件、手順を書かず状況と求める判断だけで書き、同じ入力を3回走らせて、通る・部分点・人へ返すの三段で判定する。所要時間、やり直し回数、人が手を入れた箇所、落ちた理由の分類を列にして残せば、他社と並べても同じ線で比べられます。全件落ちたときは、まず依頼文の曖昧さを疑ってその場で条件を足す。ただし相手の予算がまだ付いていない段階では、この設計は早すぎます。そこでは短いデモと、範囲を書いた一枚を先に渡してください。

出典・編集情報

記事の調査で確認した一次資料です。資料の公開・更新時期と、調査時の確認日を分けて記載しています。

  1. Demystifying evals for AI agents

    Anthropic · 2026-01-09

    確認日 2026-09-29
  2. Writing effective tools for agents — with agents

    Anthropic · 2025-09-11

    確認日 2026-09-29

AIを活用した記事制作

調査・執筆・翻訳・編集上の確認にAIを活用しています。資料に基づく事実、A&Aの考え方、仮想例は、それぞれ本文に明記しています。

編集上の確認日: 2026-09-29

← 記事一覧へ