メインコンテンツへスキップ
メニュー

A&A INSIGHTS

経営・AIの活用方針経営者向け

導入事例がまだないとき、提案に何を載せるか:自社運用の記録と、失敗から作った確認セット

導入事例がない段階の提案に載せる証拠を、自社運用の記録と失敗から作った確認セットのどちらで組むか決める基準と、見せる範囲の線引きを示します。

AI受託提案実績がない検収基準創業期の営業
Read in English
散らばった資料を整理し、比較表を作って判断につなぐ流れ
情報を集め、整理し、条件を比べて判断する流れを表した概念イラストです。 AI生成イラスト

この記事の要点

導入事例がまだないときに提案へ載せるのは、成果の数字ではなく「二人が独立に見て同じ合否になる材料」です。具体的には、自分の業務で実際に動かした記録と、実際に起きた失敗から作った合否のはっきりした確認セットの二種類で、どちらも顧客名を出さずに提出でき、買い手はその場で合否を自分で確かめられます。値引きはこのどちらでもないため、事例の不足を埋めません。

事例の代わりに出すのは、二人が見て同じ合否になる証拠

A&Aの考え方

導入事例がまだないときに提案へ載せるのは、成果の数字ではなく「二人が独立に見て同じ合否になる材料」です。具体的には二種類あります。自分の業務で実際に動かした記録と、実際に起きた失敗から作った合否のはっきりした確認セットです。どちらも顧客名を出さずに提出でき、買い手は受け取ったその場で合否を自分で確かめられます。値引きはこのどちらでもないので、事例の不足を埋めません。

出典に基づく事実

AIエージェントの評価セットについてAnthropicが2026年1月9日に公開した解説は、良い課題の条件を「two domain experts would independently reach the same pass/fail verdict」(二人の領域専門家が独立に同じ合否判定に至る)と置いている。同じ節で仕様の曖昧さについて「Ambiguity in task specifications becomes noise in metrics」(課題仕様の曖昧さは指標上の雑音になる)とも述べている。

Anthropic ↗

A&Aの考え方

この二つの文はAIエージェントの品質評価について書かれたもので、営業資料の作り方を述べたものではありません。A&Aはこれを、提案に載せる証拠の採否基準として読み替えています。読み替えると、顧客名つきの導入事例はこの基準を満たしません。買い手はその事例を再実行できず、合否を自分で判定できないからです。実績がない段階で本当に欠けているのは事例そのものではなく、相手が自分で判定できる形になった材料です。

「導入事例はありますか」と聞かれたとき、相手が確かめたいこと

A&Aの考え方

商談でこの質問が出るとき、買い手が知りたいのは他社の社名ではありません。確かめたいのはおおむね三つです。頼んだものが実際に動くのか、動かなかったときに誰が何を直すのか、そして完了と呼ぶ基準は誰が決めるのか。事例はこの三つに間接的に答える材料で、直接の答えではありません。だから事例がなくても、三つに直接答える材料があれば代わりになります。

A&Aの考え方

逆に、事例があっても三つに答えていない提案は弱いままです。「大手で導入実績あり」と書いてあっても、その案件で何を合格と呼んだのかが書かれていなければ、買い手は自分の案件の合格基準を推測するしかありません。事例の不足を社名や規模の話で埋めようとすると、この三つから遠ざかります。埋めるべきは、三つのうち自分がいま書けるものです。

提案に載せる材料を、買い手の問いと成立条件で並べ直す
提案に載せる材料それが答える買い手の問い証拠として成立する条件
顧客名つきの導入事例他社でも使われているか買い手が再実行できないため、合否を自分で判定できない。公開許諾も要る。実績がない段階では出せない
自社で動かした業務の記録本当に動かせるのか売る相手の業務と自分が動かした業務が近く、使った道具と手順のうち買い手が再現できる部分が明示されていること
失敗から作った確認セット何を合格と呼ぶのか合否が一文で書かれ、二人が独立に見て同じ判定になること。通すべきものと止めるべきものが両方入っていること
値引きどの問いにも答えていない成立しない。判定の曖昧さを残したまま単価だけ下がり、安さの理由という別の疑いが立つ
一般的な技術説明やモデル名の列挙どの問いにも答えていない成立しない。どの会社の提案にも同じ文面が書けるため、判定の対象にならない

証拠A:自社で実際に動かした業務の記録

出典に基づく事実

Gumloopは2026年2月17日、同社のサポート業務を、自社のプラットフォーム上で、全利用者に開かれているのと同じ道具を使って組んだ記録をMax Brodeur-Urbas名義で公開した。記事は冒頭で「built a fully automated support operations system, using the same tools available to every Gumloop user」と書き、末尾でも「Everything described above was built using the same Gumloop platform available to every customer」と繰り返している。同記事は体制について「our support team has only two people」とも書いている。

Gumloop ↗

出典に基づく事実

同記事は、この仕組みが一度に出来上がったものではないとも書いている。「it grew one workflow at a time, over months of continuous iteration」。作られた単位は具体的で、たとえば基盤の健全性を監視する担当は「If (and only if) a finding is actionable, it alerts a human」と条件を限って人に上げる。記事の結びの段落では「The support team saw problems and were able to build their own solutions」と書いている。

Gumloop ↗

A&Aの考え方

これは顧客事例ではなく自社運用の公開です。A&Aがここで転移すると考えるのは、見せ方ではなく成立条件です。この記録が証拠として読めるのは「すべての利用者に使えるのと同じ道具で組んだ」と明記してあるからで、買い手は同じ構成要素に手が届きます。裏返すと、自社運用の記録を提案に載せるときは、使った道具と手順のうち買い手が再現できる部分を明示する必要があります。自社だけが持つ内部データや独自基盤に依存した部分は、証拠としては効きません。読んだ相手が自分の環境に置き換えられないからです。

証拠B:実際の失敗から作った確認セット

5行2列の比較表。見出しは「どちらを主にするかは、業務の近さで決まる」。列は証拠A「自社で動かした記録」と証拠B「失敗由来の確認セット」。第1行の見出しは「答える買い手の問い」で、証拠Aは「本当に動かせるのか」、証拠Bは「何を合格と呼ぶのか」。第2行の見出しは「成立条件」で、証拠Aは「売る相手の業務と近い」、証拠Bは「二人が見て同じ判定になる」。つまり証拠Aは、使った道具と手順のうち買い手が再現できる部分が示されてはじめて証拠になり、証拠Bは、合否が一文で書かれて判定が割れないときだけ証拠になる。第3行の見出しは「作る材料」で、証拠Aは「動かし続けた構成と経緯」、証拠Bは「手で確認した項目と外した件」。第4行の見出しは「見せない範囲」で、証拠Aは「入力の実データ」、証拠Bは「取引先が分かる記述」。第5行の見出しは「効かなくなる場面」で、証拠Aは「売る業務が遠いとき」、証拠Bは「止める側がないとき」。表の要点は、二つの証拠が別の問いに答えるため、売る業務と自社の業務の距離で主従を決めるということ。Gumloop がサポート業務を全利用者に使えるのと同じ道具で組んだと明記していること、その仕組みが一度に出来上がらず継続的な反復で一つずつ増えたこと、公開しているのが構成要素と役割の分け方であって取引先名や個別の問い合わせ内容ではないことは、Gumloop の記事に基づく。評価セットの出発点を既存の手作業の確認と実際の失敗に置くこと、片側だけを試す評価は片側だけを最適化することは、Anthropic の記事に基づく。証拠Bの成立条件である判定の一致は出典の記述に基づく。証拠Aの成立条件である業務の近さ、作る材料、見せない範囲、効かなくなる場面の整理と、この二つを提案の証拠として並べる枠組みは A&Aの設計案であり、当社が測定した効果を示す図ではない。

出典に基づく事実

同じAnthropicの解説は、評価セットの出発点を新規作成ではなく既存の作業に置いている。「Begin with the manual checks you run during development」とし、すでに運用中なら「look at your bug tracker and support queue」と書いている。規模については「20-50 simple tasks drawn from real failures is a great start」とし、初期は一つの変更の影響が大きいため「this large effect size means small sample sizes suffice」と説明している。

Anthropic ↗

出典に基づく事実

同解説は着手を遅らせることの代償も述べている。「Evals get harder to build the longer you wait」。理由として、初期は製品要件がそのまま試験項目になるが、遅れると稼働中の仕組みから合格条件を逆算することになると書いている。課題ごとに「a known working output that passes all graders」(すべての判定を通る既知の正解出力)を用意し、課題が解けることと判定側が正しく組まれていることを確かめておくと有用だとしている。

Anthropic ↗

A&Aの考え方

A&Aの読み替えはこうです。確認セットは納品物の品質管理のために作りますが、作った時点で提案に載せられる材料にもなります。「この二十項目を、このデータで、この基準で確認して納品します」という一枚は、顧客名を一つも出さずに、買い手がその場で合否を判定できる材料です。しかもこの一枚は、実際に自分が踏んだ失敗から作られているので、他社の提案書から写せません。注意すべきは、出典が二十から五十という目安を述べているのはエージェントの評価セットについてであり、提案資料の項目数の基準ではないことです。

採否は一本の基準で決める:二人が独立に見て同じ判定になるか

出典に基づく事実

出典は判定の設計についても具体的に述べている。片側だけを試すことについて「One-sided evals create one-sided optimization」と書き、実例として、検索すべき問いだけを試すとほとんど何でも検索する作りになりうると説明している。経路を細かく縛ることについては、しばしば「better to grade what the agent produced, not the path it took」(経路ではなく、作られたものを採点する)ほうがよいとしている。

Anthropic ↗

A&Aの考え方

提案に載せる材料を一つずつこの基準にかけます。手順は、その材料だけを机に置いて「別の人がこれを見たら同じ合否になるか」を自分に問うことです。「精度が高い」は同じ判定になりません。何を正解と呼ぶかが書かれていないからです。「請求書100件のうち、金額・請求日・取引先名の三項目が原票と一致した件数を数え、95件以上で合格」は同じ判定になります。判定者、見る対象、数え方、境界の数値がそろっているからです。

A&Aの考え方

出典の「片側だけを試すと片側だけが最適化される」という指摘は、提案の確認セットにもそのまま効きます。「正しく処理できた件数」だけを数える確認セットは、処理してはいけないものまで処理する作りを通してしまいます。確認セットを提案に載せるなら、通すべきものと止めるべきものを両方入れておいてください。買い手が実務を知っていれば、止める側が入っているかどうかで作り手の経験を読み取ります。これは証拠の見栄えの問題ではなく、受注後に自分が守る基準の問題です。

Anthropic ↗

見せる範囲と見せない範囲を、商談前に決めておく

出典に基づく事実

Gumloopの記事が公開しているのは、構成要素と役割の分け方である。利用者情報の自動付与、障害の検知と文脈付け、問題の切り分け、返信文の整形、追跡と後追いという単位に加えて、担当エージェントの呼び名(Gummie Support、Support Captain)、組み合わせた外部サービスの名前、工程ごとのモデルの使い分けまで書かれている。付与する情報は利用者のプロフィール、活動履歴、エラー件数で、更新の間隔は30分ごとと書かれている。一方で、取引先の名前、個別の問い合わせ内容、そして各単位の出来ばえを合否で判定する基準は書かれていない。

Gumloop ↗

A&Aの考え方

A&Aの提案はこうです。まず、Gumloopが何を出して何を出していないかは、そのまま真似る対象ではありません。あの記事には、各単位の出来ばえを合否で判定する基準が書かれていないからです。提案に載せるには、構成要素に合否基準を足したものが要ります。そのうえで、線引きは商談中ではなく商談前に決めてください。見せるのは「仕組みの単位と、各単位の合否基準」まで。見せないのは「入力に使った実データ、取引先が特定できる記述、まだ自分で再現していない部分」です。この線を先に決めておく実利は、商談中に「もう少し詳しく」と踏み込まれたときに、黙るか出しすぎるかの判断をその場でしなくて済むことです。一人で商談している創業者にとって、その場の判断を一つ減らせることは小さくありません。

A&Aの考え方

ここまでを一枚にまとめたものを、本記事では証拠カードと呼びます。欄は五つです。①買い手の問い、②出す証拠、③判定者と基準、④見せる単位、⑤見せない範囲。商談の前に空欄のまま一枚用意し、埋まらない欄が残ったら、そこが準備の穴です。とくに③が埋まらないうちは、その材料はまだ提案に載せられません。このあと架空の例で埋め方を示します。

値引きがこの不足を埋めない理由

A&Aの考え方

事例がないときの値引きは、買い手の問いに答えていません。買い手が抱えているのは「完了と呼ぶ基準が分からない」という不確かさで、値引きはその基準を一文字も書き足しません。むしろ価格が下がった分、買い手の側では「安いのは何か足りないからだ」という別の疑いが立ちます。不確かさを一つ消す代わりに、二つ目を足していることになります。

A&Aの考え方

実務上の損はもう一段あります。基準を書かずに受注すると、検収の場で合否を決める材料がないので、相手の納得が得られるまで手直しが続きます。単価を下げたうえで手直しの回数が読めないという組み合わせは、初期案件でもっとも避けたい形です。確認セットを先に出すのは誠実さの表明ではなく、手直しの範囲を先に閉じるための実務です。順番としては、値段の話に入る前に判定基準を出します。

仮想例:請求書の突合を請ける一人会社の証拠カード

仮想例

以下はA&Aが説明のために作った架空の例で、実際の案件ではありません。設定はこうです。受託側は一人の開発者で、過去の納品実績は公開できない。相手は建材の卸で、仕入先から届く請求書と自社の発注記録を毎月突き合わせている。担当者は二人、月の件数は約400件。相手は商談の冒頭で、同業での導入事例を求めた。

仮想例

証拠カードの五欄を埋めます。①買い手の問い:届いた請求書の金額ずれを、人の確認より先に見つけられるか。②出す証拠:自社の経費精算で3か月動かしている同じ構成(PDFから金額・日付・取引先名を抽出し、台帳と比較して差分だけを一覧にする)と、その3か月で実際に外した28件から作った確認セット。③判定者と基準:買い手の担当者が、自社の請求書100件を投入し、三項目が原票と一致した件数と、ずれを見逃した件数を数える。一致95件以上かつ見逃し0件で合格。④見せる単位:抽出する項目の一覧、比較の手順、確認セット28項目の文面、合否の数え方。⑤見せない範囲:自社の経費データそのもの、取引先名、抽出に使っている社内の補正ルールのうち買い手が再現できない部分。

仮想例

この架空例で効いているのは、28という数字が「失敗の数」であることです。28項目は、うまくいった処理からは作れません。外した28件を見ていなければ、確認セットには「金額が一致すること」のような、誰でも書ける項目しか並びません。見逃し0件という条件を自分から置けるのも、どこで見逃すかを知っているからです。なお、この例の件数、期間、合格基準はすべて説明用の設定値で、A&Aが測定した値でもなく、この水準を達成するという約束でもありません。

転移しないもの

出典に基づく事実

Gumloopの記事は、規模の数値を同社自身の運用として掲げている。週50万件を超えるサポート関連のワークフロー、18種類のMCPツール、5分未満の応答時間である。記事が記述しているのは、この仕組みの構成と、それが一つずつ増えていった経緯である。

Gumloop ↗

A&Aの考え方

ここからはA&Aの限定です。これらは同社の運用規模の記述であって、他社が同じ水準を見込める根拠ではありません。この記事は自社製品を説明する文脈で公開されたもので、独立した監査でもありません。同じ構成が別の会社で同じ結果を出すことを測った記録でもありません。記事自身がこうした但し書きを置いているわけではないので、これらはA&Aの側で付けている限定です。

A&Aの考え方

自社運用の記録が証拠になるのは、売る相手の業務と自分が実際に動かした業務が近い場合に限られます。経費精算を動かした記録は請求書突合の提案では効きますが、問い合わせ対応の提案では「道具を扱える」証拠にしかなりません。遠い業務の記録を無理に載せると、買い手は内容よりも距離の方に気づきます。その場合は証拠Bを主にして、相手の業務で何を合格と呼ぶかを先に書く方が通ります。

A&Aの考え方

この記事が示していないことも明示します。確認セットを提示した場合に受注率や単価がどう動くかについて、A&Aは測定結果を持っていません。日本の買い手が導入事例を求める場面で、確認セットの提示が実際に単価の維持につながるかどうかも観測していません。出典の二つはいずれも海外企業が自社の技術文脈で公開した文書で、日本の受託営業について書かれたものではありません。この記事が提案しているのは、証拠の採否を判定の一致で決めるという検討の順番だけです。

次に何をするか

A&Aの考え方

一つ選んでください。すでに自分の業務で数か月動かしているものがあるなら、証拠Aを主にして、買い手が再現できる構成要素まで書き下します。動かしているものがないなら、証拠Bから始めます。出典が勧めている出発点は新規の試験項目ではなく、すでに手で確認している項目と実際の失敗なので、直近で自分が外した件を集めるところから作れます。遅らせるほど、稼働中の仕組みから合格条件を逆算する作業になります。どちらを選んだ場合も、次の商談までに証拠カードの五欄を一枚埋めてください。

Anthropic ↗

A&Aの考え方

両方あって、どちらを主にするか決まらない場合は、機密の線引きが判断を分けます。見せられる範囲が業種や過去の契約で狭まっているなら、その条件を含めて一度整理する方が早いことがあります。A&Aの初回相談は無料で、進め方を決めるだけの相談にも使えます。実装したい対象が先に決まっている場合は、相談を経ずに開発の見積もりへ進められます。

事例がない段階で欠けているのは事例ではなく、相手が自分で合否を判定できる材料です。判定が一致する証拠は二種類あります。自分の業務で実際に動かした記録と、実際の失敗から作った合否のはっきりした確認セットです。どちらを主にするかは、売る相手の業務との距離と、見せられる範囲で決まります。値引きはこのどちらでもないので、先に出すのは値段ではなく判定基準です。

出典・編集情報

記事の調査で確認した一次資料です。資料の公開・更新時期と、調査時の確認日を分けて記載しています。

  1. Supporting the world's most AI-native companies with a 2-person team

    Gumloop · 2026-02-17

    確認日 2026-10-04
  2. Demystifying evals for AI agents

    Anthropic · 2026-01-09

    確認日 2026-10-04

AIを活用した記事制作

調査・執筆・翻訳・編集上の確認にAIを活用しています。資料に基づく事実、A&Aの考え方、仮想例は、それぞれ本文に明記しています。

編集上の確認日: 2026-10-04

← 記事一覧へ