研究論文100本のうち74本が動くエージェントになった。ツールはコードではなくチュートリアルから作られた

Surya Pratap
By Surya Pratap

2026年9月27日

9 min read

AI & Technology
二部構成の図。左は Paper2Agent の処理の流れをじょうごとして描いたもので、論文のコードベースが入り、チュートリアルが見つけられて実行され、動く例がそれぞれツールに変換され、各ツールがチュートリアル自身の出力と照合してテストされ、失敗し続けるツールは MCP サーバーを組み立てる前に除外される。右は Nature で報告された結果で、AlphaGenome では約45分・約14ドルで22個のツールが作られ、チュートリアル由来の質問で98.7パーセントだった。計算生物学の論文100本では74本が593個の検証済みツールに変換され、300問のベンチマークで91.2パーセント、1問あたり約0.20ドル・1.6分だった。変換できなかった26本は、自社のドキュメントに当てはまる部分として強調されている。動くものから作るHover to explore
Paper2Agent はコードベースをそのまま包むのではない。実際に動く例を包み、それを再現できないツールは捨てる。

コードベースをエージェントに使わせようとする試みの多くは、コードから始まる。モデルをリポジトリに向け、何を呼び出せばよいかを自分で見つけさせるやり方だ。今月 Nature に掲載された論文はもっと狭いことをしており、その結果は、狭いほうのやり方こそ真似る価値があることを示している。

Paper2Agent は、Jiacheng Miao、Joe R. Davis、Yaohui Zhang、Jonathan K. Pritchard、James Zou によって 2026年9月16日に Nature に掲載された。Nature の論文は有料のため、本稿で使う公表値は、それらの数字で一致している AI Weekly の二つの要約による。処理の詳細とほかのシステムとの比較は、同じ著者による 2025年のプレプリント、つまりこの研究の以前の版によるもので、どちらの情報かは都度明記する。コードはオープンソースである。第3節以降の解釈は筆者のものである。

1. 何をするのか

Paper2Agent は研究論文とそのコードを受け取り、Model Context Protocol(MCP)サーバー を生成する。MCP に対応したアシスタントならどれでも呼び出せるツールの集まりで、それぞれのツールが論文の手法を新しいデータに適用する。

プレプリントは六つの段階を説明している。コードベースを見つける、環境を整える、チュートリアルを探す、それを実行する、動く例をそれぞれツールに変換する、ツールをまとめてサーバーにする。作業は四つのサブエージェントが分担する。環境を管理するもの、チュートリアルを探すもの、チュートリアルを関数に変換するもの、そしてテストを書いて実行するものだ。

重要なのはテストである。抽出された各ツールは、テストを書き、実行し、失敗を診断し、修正するというループの中で、チュートリアル自身の出力と照合してテストされる。プレプリントが求める水準は、ツールが元の結果を再現することだ。失敗し続けるツールはサーバーに入れない。

リポジトリにあるものをすべて包むわけではない。実際に動くと示されたものだけを包み、残りは捨てる。

2. 掲載版が報告していること

Nature 掲載版の要約によれば、次のとおりだ。

  • AlphaGenome の事例: 約 45分、約 14ドル で 22個のツール を作成し、チュートリアル由来の15問で 98.7 ± 1.3% だった。
  • 計算生物学の論文100本: 74本が変換され、593個の検証済みツール が得られた。300問のベンチマーク では 91.2 ± 1.6% で、1問あたり約 0.20ドル、1.6分 だった。
  • 26本は変換できなかった。 要約はその理由を述べていない。

1年前に公開されたプレプリントは、AlphaGenome のエージェントを二つの別の方法と、チュートリアル由来の15問と新しい15問で比較した。論文のエージェントは30問すべてに正答した。リポジトリに直接アクセスした Claude は、チュートリアル由来の問題で 15問中9問、新しい問題で 15問中12問 の正答だった。汎用の生物医学エージェントである Biomni は 15問中6問 と 15問中9問 だった。論文のエージェントは速度でも上回り、比較によって1.8倍から4.6倍速かった。

比較はサンプル数と合わせて読む

条件ごとに15問というのは少なく、しかもこれは掲載版ではなくプレプリントの数字だ。同じ事例について掲載版の数字は少し異なる。筆者がこの比較を使うのは方向性、つまりテスト済みのツール層がリポジトリへの直接アクセスを上回ったという点のためであり、差の正確な大きさのためではない。

3. 狭いやり方が勝つ理由

素のリポジトリに向けられたエージェントは、質問のたびに、どの関数が重要か、どの引数が有効か、どの順序で処理が動くか、そしてよく似た三つの補助関数のうち著者が実際に使ったのはどれかを見極めなければならない。それが得意なエージェントでも間違えることは多い。リポジトリは、どの経路が本物かを教えてくれないからだ。

チュートリアルは教えてくれる。それはこの手法はこう使うものだという著者自身の表明であり、入力、呼び出しの順序、期待される出力がそろっている。チュートリアルをツールに変えると、エージェントはすでに正解がわかっている少数の操作を手にする。各ツールをその正解と照合してテストすることで、推測は確かめられたものに変わる。

これは本番環境で、小さくて明確に定義されたツールが大きくて汎用的なツールに勝つのと同じパターンだ。選択肢が少なく、そのどれもが検証されている。Paper2Agent が加えたのは、ほとんどのプロジェクトがすでに持っている素材から、その層を自動で作る方法である。

4. 失敗した26本こそ、あなたに関係する部分だ

要約は失敗の理由を説明しておらず、筆者も論文ごとに推測することはしない。プレプリントの限界の節は一般的だが明確だ。コードベースが不完全だったり、文書化が不十分だったり、エラーを起こしやすかったりする論文は、確実には変換できない。

これを処理の仕組みと並べると、あなた自身のプロダクトが受ける試験が見えてくる。例がクリーンな環境から動かなければ、抽出するものがない。動いても期待される出力を誰も書いていなければ、照合するものがない。ドキュメントが API リファレンスしかなければ、エージェントはどの呼び出しが重要かを再び推測するしかない。

だから創業者にとっての実務的な問いは「MCP サーバーを作るべきか」ではなく、次の問いだ。

明日、誰かがこの処理をあなたの公開リポジトリにかけたら、動くテスト済みのツールはいくつ出てくるだろうか。

5. API や開発者向けプロダクトを提供しているなら

すべてのチュートリアルをゼロから実行できるようにする。 環境構築はコマンド一つで、隠れた状態はなく、「あとは何とかして認証情報を設定して」もない。作者のノート PC でしか動かないチュートリアルは、人にとってもエージェントにとっても例にならない。

期待される出力を書いておく。 結果のない例は提案にすぎない。結果があれば、それはテストになる。この一つの変更で、どんな自動処理でも、あるいは自社の CI でも、動くツールと動きそうに見えるだけのツールを区別できるようになる。

MCP サーバーはリファレンスからではなく、例から作る。 すべてのエンドポイントを公開すると、エージェントは広大な面の上で推測することになる。チュートリアルが示す10のタスクを、それぞれテストしたうえで公開すれば、小さくても確実に動く面になる。広さは後から足せばいい。

サーバーだけでなく、ツールをテストする。 起動するサーバーが動くサーバーとは限らない。ツールごとに、今もチュートリアルの出力を再現できるかを確かめるテストを用意し、リリースのたびに実行すること。API は変わり、ツールは気づかないうちにずれていくからだ。

コストの話も押さえておきたい。公表値によれば、事例の一つの変換にかかったのは約45分と14ドルで、1問あたりのコストは約0.20ドルだ。どんなプロダクトであれ、この方法で作るエージェント向けインターフェースの最初の版は、四半期がかりのプロジェクトではない。

6. 他者のコードの上にエージェントを作っているなら

同じ教訓は反対側からも当てはまる。エージェントにライブラリや社内サービス、ベンダーの SDK を使わせる必要があるなら、リポジトリを渡して祈るのはやめること。動く例を探し、それぞれを狭いツールにし、各ツールを例の結果と照合してテストし、エージェントにはそれだけを渡す。プレプリントの比較は小規模だが、本番環境での経験の大半と同じ方向を指している。動く少数のツールから選ぶエージェントは、存在するものすべてから選ぶエージェントより成果が上がる。

7. 筆者が主張しないこと

筆者は Nature の論文全文を読んでいない。 有料だからだ。公表値は同じ媒体 AI Weekly の二つの要約によるもので、筆者が使う数字はすべて両者で一致している。AlphaGenome に関するもう一つの数字、82.7%については報道が完全には一致していない。一方の要約は研究者による自由形式の質問での正答率とし、もう一方はほかのシステムとの比較として記述しているため、本稿では外した。処理の説明と比較は2025年のプレプリントによるもので、これは以前の版であり、数字が少し異なる。

対象は計算生物学である。 この分野のチュートリアルとコードは共通の慣習に従っている。例がそれほど整っていないことの多い一般的なソフトウェアで同じ成功率が保たれるかは、検証されていない。

チュートリアル由来の質問は、チュートリアル由来のツールに有利に働く。 チュートリアルから作ったツールは、同じチュートリアルから作った質問ではよい成績を出す。300問のベンチマークとプレプリントの新しい質問のほうがよい証拠だが、それらも研究者自身が作成したものだ。

失敗の分析がない。 100本のうち26本が変換されず、要約はその理由を述べていない。第4節の筆者の解釈はプレプリントの一般的な限界に基づくもので、その26本の内訳に基づくものではない。

比較は小規模である。 条件ごとに15問、プレプリントによる。示しているのは方向性であって、正確な差ではない。

正直なまとめ

Paper2Agent の見出しは、研究論文がエージェントになりうるということだ。創業者にとってより役に立つのは、その方法である。コードベースを包むのではなく、実際に動く例を抽出し、それぞれを既知の出力と照合してテストし、失敗するツールを捨てる。

そうするとドキュメントは、インターフェース仕様に近いものになる。変換できたのは、例を実行して確かめられるプロジェクトだった。できなかったものは、チュートリアルが古くなったプロダクトに何が起きるかをかなり正確に映している。

今週、自社のチュートリアルをクリーンな環境から実行し、それぞれが何を出力するはずかを書き留めること。それが、プロダクトをエージェントに使えるものにする作業の大部分だ。

出典:Jiacheng Miao、Joe R. Davis、Yaohui Zhang、Jonathan K. Pritchard、James Zou、"Reimagining research papers as interactive and reliable AI agents"、Nature、2026年9月16日。公表値は AI Weekly の要約 "Paper2Agent turns research papers into working AI agents" と "Paper2Agent converts research papers into callable AI agents" による。22個のツール、45分と14ドル、チュートリアル由来の質問での98.7 ± 1.3%、論文100本中74本、593個のツール、300問での91.2 ± 1.6%、1問あたり0.20ドルと1.6分について。同じ著者のプレプリント "Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents"、arXiv:2509.06917、2025年10月16日の v2。六段階の処理、四つのサブエージェント、テストのループと失敗するツールの除外、リポジトリにアクセスした Claude および Biomni との15問+15問の比較、実行時間の比率、記載された限界について。コード:GitHub の Paper2Agent、MIT ライセンス。第3節から第6節の解釈は筆者のものである。今年 MCP が何を変えようとしているかはMCP はノート PC の前にいる人間のために作られたを、すべてを読むエージェントが思ったより高くつく理由はエージェントが読んだファイルはすべて請求書に残るを参照。

IdeaToMVP Academy

Want to build with AI — not just read about it?

4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.

Explore the Academy →
Share this post :