メインコンテンツへスキップ
メニュー

A&A INSIGHTS

経営・AIの活用方針経営者向け

AI調査はマルチエージェントに分けるべきか:問いの独立性で決める

調査を並列化したいとき、判断を決めるのはモデルの性能ではなく問いの形です。互いの中間結果を必要としない独立した方向に分解できるかを先に確かめ、統合と確認の手間を費用側に入れる手順を示します。

AI調査サービスマルチエージェント受託の見積もりAI納品品質一人・少人数
Read in English
散らばった資料を整理し、比較表を作って判断につなぐ流れ
情報を集め、整理し、条件を比べて判断する流れを表した概念イラストです。 AI生成イラスト

この記事の要点

調査を複数エージェントに分けるべきかは、モデルの性能ではなく、受けている問いが互いの中間結果を必要としない独立した方向に分解できるかで決まります。分解できる案件にだけ方向ごとの委任条件を書き、分けた本数分の確認時間と統合の費用を見積もりに入れてから決めてください。

答え:分けるかどうかは、モデルの性能ではなく問いの形で決まる

A&Aの考え方

調査を並列に分けるかどうかは、受けている案件の問いが、互いの中間結果を必要としない独立した方向に分解できるかで決まります。分解できるなら分業が効き、分解できないなら、エージェントを増やすほど重複と取りこぼしが増えます。判断の順番は三つです。第一に、問いを方向へ分解して、方向ごとに独立かどうかを一行で書く。第二に、独立な方向にだけ委任の条件を書く。第三に、分けた本数分の確認時間と統合の手間を見積もりに入れる。この三つを書き終える前に構成を変える理由はありません。

出典に基づく事実

Anthropicが自社のResearch機能について公開した技術記事には、社内評価の結果として「multi-agent research systems excel especially for breadth-first queries that involve pursuing multiple independent directions simultaneously(複数の独立した方向を同時に追うような幅優先の問いで、複数エージェントの調査システムは特に優れている)」と書かれています。同記事は、Claude Opus 4を統括役、Claude Sonnet 4をサブエージェントにした構成が、単体のClaude Opus 4を社内の調査評価で90.2%上回ったとも述べています。

Anthropic ↗

出典に基づく事実

同じ記事は、向かない領域も明示しています。「some domains that require all agents to share the same context or involve many dependencies between agents are not a good fit for multi-agent systems today(すべてのエージェントが同じ文脈を共有する必要がある領域や、エージェント間の依存が多い領域は、現時点では複数エージェントに向かない)」。具体例として、ほとんどのコーディング作業は調査ほど真に並列化できる部分が少ない、と書かれています。

Anthropic ↗

出典に基づく事実

Anthropicのもう一つの記事「Building effective agents」は、LLMで何かを作るときの原則として「finding the simplest solution possible, and only increasing complexity when needed(可能な限り単純な解を見つけ、必要になったときにだけ複雑さを増やす)」を挙げ、それはエージェント的な仕組みをまったく作らないという判断を含みうるとしています。同記事はまた「Agentic systems often trade latency and cost for better task performance(エージェント的な仕組みは、遅延と費用を作業性能の向上と引き換えにすることが多い)」と述べ、その取引が成立する場面かどうかを考えるべきだとしています。

Anthropic ↗

A&Aの考え方

この二つを重ねると、読者の判断は「分けるか磨くか」から「この案件の問いは幅優先の洗い出しか、それとも一本の筋を追う調査か」へ置き換わります。幅優先なら分ける価値があり、一本の筋なら分けても速くなりません。そしてこの見分けは、実装を一行も触らずに、受注時の依頼文だけでできます。以下は、その見分け方と、分けると決めたあとに書くものの話です。

独立かどうかは一行で書ける:前の答えが要るか

2×2の判断図。縦軸は方向ごとに当たる資料が分かれるか同じ一集合か、横軸は方向が互いに依存するか独立か。四つの組のうち、右上の「資料が分かれる×独立」だけが「分ける(手分けが成り立つ唯一の組。方向ごとに四項目を書く)」で強調されている。残る三つはいずれも「分けない」で、左上は前の方向の答えを待つため並列にならない、左下は単一の指示と道具を磨く、右下は探索の空間が広がらず同じ資料を読み直すだけ。独立性だけでなく資料の分かれ方も条件であることを示している

A&Aの考え方

独立の判定はごく単純です。分解した方向を一つずつ取り上げ、「この方向を調べ始めるのに、他の方向の答えが必要か」と問うだけです。必要なら独立していません。必要でないなら独立しています。専門的な前提はいりませんし、実装を見る必要もありません。必要なのは、依頼文を方向へ割ってから、方向ごとにこの一行を書く手間だけです。

仮想例

仮の例で並べます。A&Aの実績ではありません。依頼1は「国内の業務用冷蔵設備メーカーのうち、遠隔監視サービスを自社で提供している会社を洗い出してほしい」。これを大手・中小・業界団体名簿という三方向に割っても、どの方向も他の方向の答えを待ちません。依頼2は「ある持株会社の実質的な議決権が誰にあるかを、公開資料から追ってほしい」。こちらは一段目の株主が確定するまで二段目を調べられず、三段目はさらにその先です。同じ「調査」という言葉で受けていても、分業が効くのは依頼1だけです。依頼2で台数を増やすと、全員が同じ一段目を待つか、確定していない前提の上で別々に走り出します。

出典に基づく事実

Anthropicの記事は、サブエージェントが有効になる理由を「the essence of search is compression(検索の本質は圧縮である)」という言い方で説明しています。サブエージェントはそれぞれ自分の文脈領域を持って並列に動き、問いの別々の側面を同時に探索したうえで、最も重要なトークンだけを統括役へ凝縮して渡す、と書かれています。同記事はさらに、サブエージェントごとに道具・指示・探索の軌跡が分かれること自体が関心の分離になり、先に見たものへ引きずられる度合いを減らして、徹底した独立の調査を可能にするとしています。

Anthropic ↗

A&Aの考え方

ここから読み取れる実務上の意味は、分業の利得が「台数」ではなく「文脈の分離」から来るということです。同じ資料一式を全員に読ませてから手分けさせるのは、文脈を分離していません。それは一台で順に読むのと情報量が変わらないまま、料金だけが増える構成です。分けるなら、方向ごとに当たる資料も分かれている必要があります。資料が分かれないなら、分ける理由はありません。

問いの形から分業の向きを判定する(A&Aの整理。出典の表の翻訳ではありません)
受注時に見分ける問いの形分業の向き先に決めておくこと
同じ対象について、互いに関係のない複数の側面を洗い出す分ける(手分け)方向ごとの四項目と、重複を防ぐ境界
一つの筋を順に追う。前の答えがないと次を調べられない分けない単一の指示と道具を磨く。中断からの再開
全員が同じ最新の文脈を共有し続ける必要がある分けない文脈を一つに保つ置き場所
同じ問いに複数の見方を当てて確度を上げたい分ける(二重チェック)統合せずに並べる出力形式と採用の票数
事実を一つ確かめるだけ分けない道具の呼び出し回数の上限
どの結論がどの資料に対応するかを示す必要がある分けない(別工程にする)調査ループの後に置く対応付けの工程

分けると費用は桁で増える:15倍という数字の使い方

出典に基づく事実

同記事は費用について率直に書いています。「There is a downside: in practice, these architectures burn through tokens fast(欠点もある。実際にはこの構成はトークンを速く燃やす)」。同社のデータでは、エージェントは対話利用の約4倍、複数エージェントの仕組みは対話利用の約15倍のトークンを使うとされています。そのうえで「For economic viability, multi-agent systems require tasks where the value of the task is high enough to pay for the increased performance(経済的に成立させるには、性能の向上分を支払えるだけ価値の高い作業が必要になる)」と続きます。

Anthropic ↗

出典に基づく事実

性能がどこから来るかについても数字が出ています。BrowseCompという評価で、性能のばらつきの95%を三つの要因で説明でき、そのうち「token usage by itself explains 80% of the variance(トークン使用量だけでばらつきの80%を説明する)」と書かれています。残る二つは道具の呼び出し回数とモデルの選択です。同記事はこれを、別々の文脈領域へ作業を分散させて並列推論の容量を増やす構成の妥当性を裏づけるものとしています。

Anthropic ↗

A&Aの考え方

この数字の使い方には注意が必要です。15倍も90.2%もAnthropicの社内評価と自社データで、母数・期間・作業の種類は示されていません。日本の小規模な調査受託に同じ倍率が出るとは言えませんし、この記事もそれを推定しません。使えるのは倍率そのものではなく、費用が「桁で増える」側にあるという事実です。受注単価を動かさないまま構成だけ分業に変えれば、粗利は確実に減ります。だから分業を選ぶ判断には、値段か対象範囲のどちらかを一緒に動かす判断が必ず付いてきます。

A&Aの考え方

順番はこうです。分けると決めた案件については、見積もりの内訳に四つを持ってください。分けた方向の本数、1方向あたりに払う推論費用の上限、統括して統合するための費用、そして結論と出典を対応付ける工程の費用。この合計が単価に収まらないなら、分けないか、対象範囲を狭めるかの二択になります。「速くなるから分ける」は理由になりません。速さが単価か受注可能な件数のどちらかに反映される契約になっているかどうかが、理由です。

分けると決めたら、方向ごとに四項目を書く

出典に基づく事実

統括役がサブエージェントへ渡すべきものについて、同記事は四つを挙げています。「Each subagent needs an objective, an output format, guidance on the tools and sources to use, and clear task boundaries(各サブエージェントには、目的、出力形式、使う道具と情報源の指針、そして明確な作業の境界が必要)」。詳しい作業記述がないと、エージェントは作業を重複させ、抜けを残し、あるいは必要な情報を見つけられない、と書かれています。

Anthropic ↗

出典に基づく事実

実際に起きた失敗も具体的に記録されています。初期には統括役に「research the semiconductor shortage(半導体不足を調べて)」のような短い指示を出させていたところ、その指示が曖昧すぎて、サブエージェントが作業を取り違えたり、他のエージェントとまったく同じ検索をしたりしました。一例として「one subagent explored the 2021 automotive chip crisis while 2 others duplicated work investigating current 2025 supply chains(あるサブエージェントが2021年の自動車向けチップ危機を調べている間に、他の2台が2025年の現在の供給網を重複して調べていた)」とあり、有効な分業になっていなかったと述べられています。

Anthropic ↗

A&Aの考え方

これは受託の現場にそのまま移せます。分けると決めた方向ごとに、四行の委任カードを書いてください。目的は、この方向で確定させたい一文。出力形式は、表の列名まで決めた形。情報源は、当たる資料と、当たらない資料の両方。境界は、他の方向が担当するので触らない範囲です。四行目が一番効きます。重複は能力の問題として現れますが、原因は境界を書かなかったことです。書かれていない境界を、エージェントが推測して守ることはありません。

仮想例

仮の例で、先の依頼1を三方向に分けるとこうなります。方向1は「業務用冷蔵設備の大手5社について、遠隔監視サービスの提供有無を製品ページから確定させる。出力は会社名・製品名・サービス名・URL・取得日の5列。境界として、中小メーカーは扱わない」。方向2は中小メーカーを同じ5列で扱い、境界として大手5社を除外します。方向3は業界団体の会員名簿と展示会の出展社一覧から、方向1と方向2が拾えなかった社名だけを追加し、境界として、すでに扱われた社の再調査を禁じます。この例は書き方を示すためのもので、実在の調査結果でも当方の納品物でもありません。

増やす本数を、問いの複雑さに合わせる

出典に基づく事実

本数の目安も公開されています。エージェントは作業に見合う労力を自分で判断するのが苦手なので、規模を決める規則を指示に埋め込んだ、と書かれています。「Simple fact-finding requires just 1 agent with 3-10 tool calls(単純な事実確認なら道具呼び出し3〜10回の1台で足りる)」。直接の比較なら2〜4台でそれぞれ10〜15回、複雑な調査なら責任範囲を明確に分けた10台以上が必要になりうる、と続きます。初期には「spawning 50 subagents for simple queries(単純な問いに50台のサブエージェントを立ち上げる)」という失敗があったとも書かれています。

Anthropic ↗

出典に基づく事実

「Building effective agents」は、並列化を二つに分けて説明しています。Sectioningは「Breaking a task into independent subtasks run in parallel(作業を独立した部分作業に割って並列に走らせる)」もの、Votingは同じ作業を複数回走らせて多様な出力を得るものです。そして「Parallelization is effective when the divided subtasks can be parallelized for speed(割った部分作業が速度のために並列化できるとき)」、または高い確度のために複数の観点や試行が必要なときに、並列化は効くとされています。

Anthropic ↗

A&Aの考え方

受託の言葉に置き換えると、Sectioningは手分け、Votingは二重チェックです。この二つは費用を払う理由が違います。手分けは納期のために払う費用、二重チェックは間違えたときの損失のために払う費用です。だから見積書では別の行にしてください。「複数エージェントで調査します」と一語にまとめると、顧客は納期を買ったのか精度を買ったのか分からなくなり、値引き交渉の対象が何なのかも決まりません。二重チェックを入れるなら、どの結論に対して何票で採用するかも先に決めます。

A&Aの考え方

そして、単純な問いに台数を足すのは、同記事が初期の失敗として記録している方向そのものです。一件の事実確認に分業を持ち込む必要はありません。抱えている案件の一覧を見て、どれが事実確認でどれが幅優先の洗い出しかを先に色分けするだけで、台数の議論はほとんど片付きます。色分けができないなら、それは構成の問題ではなく、依頼の受け方が曖昧だという合図です。

人を雇うのと分けるのは、同じ軸に乗らない

A&Aの考え方

ここから先は出典の外側です。参照した二つの記事は、いずれも人の採用を論じていません。以下はA&Aの読み方です。サブエージェントを1台増やすことと、人を1人増やすことは、代替可能な単位として並びません。理由は、調べる手が足りているかどうかではなく、分業の設計そのものを誰が書くかにあります。

出典に基づく事実

同記事は、複数エージェントの仕組みでは調整の複雑さが急速に増すと述べ、各エージェントは指示で操縦されるため、指示の設計が振る舞いを改善する主要な手段だったとしています。また、これらの仕組みには特定のプログラムなしに現れる創発的な振る舞いがあり、統括役への小さな変更がサブエージェントの動きを予測しづらく変えることがあると書かれています。成功には個々の振る舞いだけでなく相互作用の型を理解する必要があり、良い指示とは厳密な命令ではなく「frameworks for collaboration that define the division of labor, problem-solving approaches, and effort budgets(分業、問題解決の進め方、労力の予算を定める協働の枠組み)」だとしています。

Anthropic ↗

A&Aの考え方

つまり、分けるという選択は「調べる手が増える」ことではなく「分業を設計して維持する仕事が新しく増える」ことです。方向の切り方、境界の書き方、統合の判断、予測しづらい失敗の追跡。この仕事は台数を増やしても減らず、増えます。一人の事業でここが詰まっているなら、増やすべきはサブエージェントではなく、問いを分解して境界を書ける人です。逆に、分解はすでにできていて手が足りないだけなら、人を雇う前に分業を試す順番に合理性があります。判断の材料は能力の比較ではなく、いま詰まっているのが分解か実行かという一点です。

出典に基づく事実

維持の費用にも触れられています。エージェントは動的に判断し「non-deterministic between runs, even with identical prompts(同一の指示でも実行ごとに非決定的)」であるため、デバッグが難しくなると書かれています。利用者から明らかな情報を見つけられないという報告があっても理由が見えず、本番の追跡記録を全面的に入れて初めて系統的に原因を診断できるようになった、とされています。また、エージェントは状態を持ち誤りは積み上がるため、途中から再開できる仕組みと、再試行や定期的な検査点といった決定的な安全策を組み合わせたとも書かれています。

Anthropic ↗

A&Aの考え方

一人の事業にとって、これは分業を入れると観測の道具が必要になるという意味です。どの方向が何を検索し、どこで空振りしたかが後から見えないなら、品質が落ちたときに直す対象を特定できません。納品物の質を約束している受託では、これは任意の贅沢ではなく前提条件です。分業を試すなら、方向ごとの検索記録と失敗の残し場所を先に作ってください。作れないなら、その案件では分けないという結論が正しい結論です。

この判断が成り立たない場面と、次の一歩

A&Aの考え方

限界を四つ書きます。第一に、引用した数値はすべてAnthropicの社内評価と自社データで、独立した監査ではありません。90.2%も15倍も、評価対象・母数・作業の種類が日本の小規模な調査受託と同じではなく、この記事は桁の感覚としてのみ使い、費用対効果の推定には使っていません。第二に、Anthropicはモデルを提供する側であり、複数エージェントの構成が有利に見える立場にあります。第三に、「Building effective agents」は2024年12月の記事で、記事自身が「the tooling landscape described in this post has changed since December 2024(この記事で述べた道具の状況は2024年12月から変わっている)」と注記しています。設計の原則は読めますが、具体的な道具の話は現在の状況で確かめ直す必要があります。第四に、どちらの記事も製品を作る開発者向けで、顧客に調査を納品する受託事業の契約・検収・責任の話は扱っていません。その部分はすべてA&Aの解釈です。

A&Aの考え方

主張が成り立たない場面も挙げます。問いが幅優先に分解できていても、顧客が求めているのが網羅ではなく一つの決定的な資料なら、分業の利得は納品価値になりません。十の方向から集めた広い表よりも、核心の一枚に辿り着くことが対価の対象だからです。もう一つは、扱う資料が同じ一つの限られた集合、たとえば顧客の社内資料や特定のデータベースに閉じている場合です。方向を分けても探索の空間は広がらず、同じ資料を別々に読み直すだけになります。こちらは、出典が向かないと述べる「すべてのエージェントが同じ文脈を共有する必要がある領域」に近い形です。

A&Aの考え方

次の一歩は実装ではありません。いま抱えている調査案件を三件書き出し、それぞれの問いを方向に分解して、方向ごとに「他の方向の答えが要るか」を一行で書いてください。独立な方向が二つ以上ある案件が一件もなければ、分業の検討は今は不要です。一件以上あれば、その案件だけで四行の委任カードを書き、分けた本数分の確認時間を見積もりに足してみてください。納品後の確認時間そのものの見積もり方は「AI受託を増やす前に、人の確認で詰まる量を見積もる」で扱っています。顧客獲得から納品・継続までの流れの中でこの判断がどこに位置するかは「AIネイティブGTMとは?一人・少人数で顧客獲得から継続まで回す実践ガイド」を参照してください。分解が案件ごとに毎回難しいなら、それは構成の課題ではなく受注時の要件定義の課題で、個別の相談に向く論点です。

分けるか、磨くか、雇うか。この三択を先に決めようとすると答えは出ません。決まるのは、受けている問いが独立した方向に分解できるかを書き出したあとです。分解できる案件にだけ方向ごとの四項目を書き、分けた本数分の費用と確認時間を見積もりへ入れる。分解できない案件では、台数ではなく一本の指示と道具を磨く。引用した数値は他社の社内評価であり、当方の実測でも、貴社の費用対効果の予測でもありません。

出典・編集情報

記事の調査で確認した一次資料です。資料の公開・更新時期と、調査時の確認日を分けて記載しています。

  1. How we built our multi-agent research system

    Anthropic · Jun 13, 2025 (as shown on the page)

    確認日 2026-09-30
  2. Building effective agents

    Anthropic · Dec 19, 2024 (page date); page notes tooling has changed since

    確認日 2026-09-30

AIを活用した記事制作

調査・執筆・翻訳・編集上の確認にAIを活用しています。資料に基づく事実、A&Aの考え方、仮想例は、それぞれ本文に明記しています。

編集上の確認日: 2026-09-30

← 記事一覧へ