A&A INSIGHTS
同じ入力で同じ結果が出ないAI納品物を、検収条件にどう書くか
検収のやり直しで商談時と違う出力が出てしまい、契約書で止まっている受託事業者へ。Anthropicのツール設計と評価の解説をもとに、再現性の約束を「出力の同一性」から「判定基準の同一性」へ移す書き方をA&Aが整理します。
Read in English
この記事の要点
約束できるのは判定基準の同一性です。つまり「誰が、何を見て、どの基準で合格と言うか」と「何回まで走らせて合否を決めるか」を着手前に文章にしておくこと。AI納品物の再現性は、出力を固定することでは約束できません。「毎回同じ結果が出ます」と書いた時点で、その条項は守れない約束になります。
約束できるのは出力の同一性ではなく、判定基準の同一性
A&Aの考え方
約束できるのは判定基準の同一性です。すなわち「誰が、何を見て、どの基準で合格と言うか」と「何回まで走らせて合否を決めるか」を、着手前に文章にしておくこと。検収のやり直しで、商談で見せたときとは違う文面や分類が出た——この経験をした後で契約書に向かうと、「毎回同じ結果が出ます」と書けずに手が止まります。A&Aの結論は、書けないのではなく書いてはいけない、というものです。
A&Aの考え方
この置き換えは、要求を下げることではありません。むしろ、多くの契約書が暗黙に置いている「同じ入力なら同じ出力」という前提を、明示的な合格条件に書き換える作業です。前提のままにしておくと、出力が揺れたときに顧客と自分のどちらが正しいかを決める材料がなく、毎回の無償のやり直しとして処理されます。
A&Aの考え方
この記事では、出典に書かれている技術的な記述、A&Aによる受託契約への読み替え、架空の記入例を分けます。出典はいずれも評価環境とツール設計についてのエンジニアリング解説であり、日本の受託契約の法的有効性や条項の書き方を保証するものではありません。契約文面の妥当性は、読者ご自身の顧問にご確認ください。
Anthropic:決定的なシステムと、非決定的なエージェントのあいだの契約
出典に基づく事実
Anthropicが2025年9月11日に公開したツール設計の解説は、計算機の文脈で「決定的なシステムは同一の入力に対して毎回同じ出力を生む」(deterministic systems produce the same output every time given identical inputs)とし、エージェントのような非決定的なシステムは同じ出発条件でも異なる応答を生みうる、と説明しています。
出典に基づく事実
同解説は続けて、従来のソフトウェアを書くことは決定的なシステム同士の契約を結ぶことであり、たとえばgetWeather("NYC")という関数呼び出しは毎回まったく同じやり方でニューヨークの天気を取得する、と述べます。そのうえでツールを「決定的なシステムと非決定的なエージェントのあいだの契約」(a contract between deterministic systems and non-deterministic agents)を反映した新しい種類のソフトウェアだと位置づけています。
出典に基づく事実
同解説は、利用者が「今日は傘を持っていくべきか」と尋ねたとき、エージェントは天気のツールを呼ぶかもしれないし、一般的な知識から答えるかもしれないし、場所を先に尋ね返すかもしれない、と具体例を挙げています。ときには誤った内容を生成したり、ツールの使い方を把握できないこともある、とも書かれています。
A&Aの考え方
A&Aがここから借りるのは、契約という語の使い方です。この解説は、非決定性を前提にしたうえで、それでも契約は結べると述べています。ただしその契約が固定しているのは出力ではなく、境界と応答の意味です。受託契約に読み替えると、固定すべきなのは納品物の文字列ではなく、「その納品物が何を満たしていれば受け取ってよいか」という境界になります。
| 検収条件の要素 | 出力の同一性で書く場合 | 判定基準の同一性で書く場合 |
|---|---|---|
| 合格の定義 | 商談で見せた出力と一致すること | 定めた条件をすべて満たすこと |
| 判定する人 | 書かれていないことが多い | 名前または役割と、見る資料を併記する |
| 走らせる回数 | 一回(暗黙) | 代表件数×回数と、何回の合格で納品とするか |
| 顧客の再実行で結果が変わった | 瑕疵の主張になり、無償で直す | 合格基準を満たせば瑕疵にあたらないと事前に明示 |
| 基準で判定できない依頼 | その場で交渉する | 対象外として先に列挙する |
| 判定の記録 | 残っていない | 入力・出力・判定記録を誰がいつまで保持するか |
| 成果物の種類の違い | すべて同じ条項で扱う | 抽出と生成で合格基準の粒度を分ける |
評価の三語:課題・試行・採点者を、検収条件の三欄に置く
出典に基づく事実
Anthropicが2026年1月9日に公開した評価の解説は、用語を明示的に定義しています。課題(task)は「定義された入力と成功基準を持つ一つのテスト」(a single test with defined inputs and success criteria)であり、課題への一回一回の試みが試行(trial)です。そして「モデルの出力は実行ごとに変わるため、より一貫した結果を得るために複数回の試行を走らせる」(Because model outputs vary between runs, we run multiple trials)と書かれています。
出典に基づく事実
同解説は採点者(grader)を、エージェントの性能の何らかの側面を採点する論理と定義し、一つの課題が複数の採点者を持ちうるとしています。さらに、結果(outcome)は試行の終了時点における環境の最終状態だとし、航空券予約のエージェントが「予約が完了しました」と言ったとしても、結果とは環境のデータベースに予約が存在するかどうかである、という例を挙げています。
出典に基づく事実
同解説は良い課題の条件も示しており、「二人の分野の専門家が独立に同じ合否の判定に至る」(two domain experts would independently reach the same pass/fail verdict)ような課題が良い課題だと述べています。課題の記述が曖昧であれば、それは指標の雑音になるとも書かれています。
A&Aの考え方
A&Aの読み替えでは、この三語がそのまま検収条件の三欄になります。課題は「顧客が実際に出す依頼の代表例」、試行は「何回まで走らせるか」、採点者は「誰が何を見て合否を言うか」です。そして結果の定義が最も効きます。納品物が「できました」と書いてあることではなく、顧客側の記録に何が存在すれば完了なのかを書く。これは技術的な定義ではなく、検収の文面として直接使えます。
「毎回同じ」が守れない約束である理由:k回すべて通る確率
出典に基づく事実
同じ評価の解説は、一貫性を測る指標としてpass^kを挙げています。「pass^kはk回の試行すべてが成功する確率を測る」(pass^k measures the probability that all k trials succeed)とし、kが増えるほどpass^kは下がる、より多くの試行にわたる一貫性を求めることはより高い基準を課すことだから、と説明しています。具体例として、試行あたりの成功率が75%のエージェントを3回走らせた場合、三回すべてに通る確率は0.75の三乗で約42%だと示されています。
出典に基づく事実
同解説は、この指標が特に顧客と接するエージェントで重要になると述べています。利用者が「毎回」信頼できる挙動を期待する場面だからです(users expect reliable behavior every time)。また、同じ課題であっても、あるときは通り、次の実行では落ちることがある、とも書かれています。さらに同解説は、試行を増やすとpass@kとpass^kは逆向きに動くとし、k=10では「pass@kは100%に近づき、pass^kは0%へ落ちる」と述べています。
A&Aの考え方
A&Aの読み替えはこうです。pass^kが扱っているのは「基準に合格し続けること」であって、「同じ文字列が出続けること」ではありません。そして出力の同一性は、基準の合格より強い約束です。基準への合格ですらkが増えるほど保証が難しくなるのだから、文言の一致を約束するのはそれより無理があります。契約書に「毎回同じ結果が出ます」と書くことは、この強いほうの約束を回数の上限なしに引き受けることです。守れない約束を書いた契約は、顧客を守っているように見えて、実際には「どこからが違反か」を誰も判定できない状態を作るだけです。
出典に基づく事実
非独立性については同解説自身が述べています。複数の別々の試行が環境の同じ制約(例として限られたCPUメモリ)によって落ちる場合、それらの試行は同じ要因の影響を受けているため独立ではなく、評価結果はエージェントの性能の測定としては信頼できなくなる、という記述です。
A&Aの考え方
ここから受託への注意が出ます。0.75の三乗という計算は三回の試行が独立だと仮定した場合の値であり、実際の受託では同じ入力の癖や同じ資料の欠損が原因で三回とも同じように失敗することがあります。ただし独立でないことは結論を弱めません。変わるのは確率がどれだけ速く下がるか(あるいは下がるかどうか)だけで、「毎回」という約束は一度違えば破れるからです。またこの数字は評価環境における測定の話であって、納品物の品質保証の手法としてそのまま使えるとは限りません。借りているのは「一貫性を求めるほど基準が高くなる」という向きであり、数値そのものではありません。
検収条件に書く六行

出典に基づく事実
この置き換えの考え方そのものは、評価の文脈では出典側に明示されています。ツール設計の解説は、評価の検証器について「書式・句読点・妥当な言い換えのような見かけ上の差異を理由に、正しい応答を落としてしまう厳しすぎる検証器は避けること」(Avoid overly strict verifiers that reject correct responses due to spurious differences like formatting, punctuation, or valid alternative phrasings)と述べています。評価の解説も、文字列一致などのコードによる採点者の弱点として「期待したパターンに正確に一致しない妥当な揺れに対して脆い」(Brittle to valid variations that don’t match expected patterns exactly)を挙げ、さらに「エージェントが通った経路ではなく、生み出したものを採点するほうがよいことが多い」とし、構成要素が複数ある課題では部分点(partial credit)を組み込むよう勧めています。
A&Aの考え方
A&Aが提案する六行はこうです。(1) 合格基準:納品物が何を満たしていれば合格かを、出力の文言ではなく満たすべき条件として書く。(2) 判定者:合否を言う人を名前または役割で特定し、その人が見る資料を併記する。(3) 試行回数:何件を何回走らせ、何件が何回通れば納品とするか。(4) 再実行の扱い:検収後に顧客が再実行して結果が変わった場合、それが瑕疵にあたるかどうか。(5) 対象外:合格基準で判定できない依頼の種類。(6) 保存物:合否の判定に使った入力・出力・判定記録を、どちらがいつまで保持するか。
A&Aの考え方
A&Aが最も争点になりやすいと見ているのは四行目です。検収時に合格したものを顧客が後日自分で走らせ、違う結果が出たときに何が起きるか。ここを書いていない契約では、その一回が瑕疵の主張になり得ます。A&Aの提案は、四行目を「合格基準を満たしていれば、出力の文言が異なっても瑕疵にあたらない」と明示し、そのうえで「合格基準を満たさない結果が出た場合の窓口と対応期間」を別に書くことです。
A&Aの考え方
二行目については、評価の解説が示す「二人の専門家が独立に同じ合否に至るか」を自分への問いとして使えます。書いた合格基準を、自分と顧客側の担当者が別々に読んで同じ判定に至るか。至らないなら、それは基準ではなく感想です。A&Aの想定では、この確認を契約締結前に一度やっておくと、後の交渉で詰める論点が減ります(効果は測定していません)。
架空の例:問い合わせの要約と分類を納品する場合
仮想例
以下は架空の例で、実在の顧客や当社の実績ではありません。顧客の問い合わせメールを要約し、五つの区分のいずれかに分類して返す処理を納品するとします。商談では十件のサンプルできれいに動きましたが、検収の場で同じ十件を走らせたところ、要約の文面が変わり、一件は分類が変わりました。
仮想例
六行を埋めると次のようになります。合格基準は「分類は正解区分と一致すること」「要約は、元のメールに書かれていない事実を含まないこと、かつ依頼の主題と希望期日が含まれること」。判定者は顧客側の受付担当者で、見る資料は元のメールと出力の対。試行回数は代表30件を3回ずつ。合否は件数の閾値で決め、分類は「3回とも同じ正解区分に落ちた件数が30件中28件以上」、要約は「3回とも合格基準を満たした件数が30件中28件以上」とする。再実行時は、要約の文言が異なっても合格基準を満たせば瑕疵としない。対象外は、一通に複数の用件が含まれる場合と、添付の内容を読まないと判定できない場合。保存物は入力・出力・判定記録を六か月、受託側が保持する。
A&Aの考え方
A&Aが強調したいのは、この書き方が要求を下げていないことです。分類については「3回とも同じ区分」という、出力の同一性に近い厳しい条件を置いています。一方で要約については、文言の一致ではなく二つの条件(虚偽を含まない、主題と期日を含む)に置き換えました。件数の閾値を置いたのは、構成要素が複数ある課題では部分点を組み込むよう勧める出典の考え方に沿ったもので、閾値そのものの水準はA&Aが置いた架空の値です。同じ納品物の中でも、成果物の性質によって約束できる形が違います。数値抽出と文章生成を同じ検収条件で扱わないことが、この六行を実際に使うときの最初の分岐です。
この読み替えが成り立たない条件と、主張しないこと
A&Aの考え方
出典はいずれもAnthropicが公開したエンジニアリング解説であり、評価環境とツール設計についての技術的記述です。日本の受託契約における条項の有効性、瑕疵担保や契約不適合責任の扱い、消費者契約への適用可否については何も述べていません。この記事の六行は業務設計の提案であって契約書の雛形ではなく、条項の妥当性は読者ご自身の顧問にご確認ください。
A&Aの考え方
試行回数を増やせば一貫した結果に近づくという記述は、評価における測定の話です。納品物の品質保証の手法としてそのまま転用できるとは限らず、受託への読み替えはA&Aの仮説です。またpass^kの計算例は試行が独立である前提の値であり、同じ資料の欠損が原因で毎回同じように失敗する場合、その数値は当てはまりません(結論の向きは変わりません)。
A&Aの考え方
再現性として何を約束できるかは、成果物の種類によって大きく異なります。評価の解説も、答えが客観的に定まる課題(「X社の第3四半期の売上は」)では完全一致が使えるとする一方、調査の品質のように主観が入るものではLLMによる採点基準を専門家の判断と繰り返し突き合わせて較正すべきだとしており、種類によって採点の形を変えています。数値の抽出、区分の分類、文章の生成、画像の生成では、合格基準の書ける粒度が違います。この記事は、六行を書けば紛争が減る、受注が増える、やり直しが何割減る、といった効果を一切主張しません。当社の成約実績や顧客における再現率も示しません。
次の一歩:いま止まっている一件で、二行目だけ書く
A&Aの考え方
六行を一度に埋める必要はありません。いま契約で止まっている案件について、二行目の「判定者」だけを書いてみてください。合否を言う人を特定し、その人が何を見れば判定できるかを書く。ここが書けないまま進んだ案件では、納品後に判定者が現れて基準が後から生まれる可能性があります。書けたら、その人が読んで同じ判定に至る合格基準を一行だけ足してください。
A&Aの考え方
有償の検証段階で、デモと検収をどう分けるかについては「AIサービスの有料PoCで何を約束するか:デモと検収条件を分ける」があります。合格基準を作った後に、人の確認がどれだけ供給能力を縛るかは「AI受託を増やす前に、人の確認で詰まる量を見積もる」で扱いました。全体の流れは「AIネイティブGTMとは?一人・少人数で顧客獲得から継続まで回す実践ガイド」にまとめています。対象の業務が決まっていて、判定と記録の仕組みまで作りたい場合は、開発のご相談として個別にご連絡ください。
AI納品物の再現性は、出力を固定することでは約束できません。Anthropicのツール設計の解説は、決定的なシステムが同じ入力に同じ出力を返すのに対し、エージェントは同じ出発条件でも異なる応答を生みうるとし、それでもツールを「契約」と呼びます。評価の解説は課題を「定義された入力と成功基準を持つ一つのテスト」と定義し、出力が実行ごとに変わるから複数回走らせると述べ、k回すべてに通る確率は一貫性を求めるほど下がると示しています。だから契約に書くのは、誰が何を見てどの基準で合格と言うか、何回走らせるか、再実行で文言が変わった場合の扱い、そして対象外です。条項の法的な妥当性は、読者ご自身の顧問にご確認ください。
出典・編集情報
記事の調査で確認した一次資料です。資料の公開・更新時期と、調査時の確認日を分けて記載しています。
- Writing effective tools for agents
Anthropic · 2025-09-11
確認日 2026-10-02 - Demystifying evals for AI agents
Anthropic · 2026-01-09
確認日 2026-10-02
AIを活用した記事制作
調査・執筆・翻訳・編集上の確認にAIを活用しています。資料に基づく事実、A&Aの考え方、仮想例は、それぞれ本文に明記しています。
編集上の確認日: 2026-10-02