AI チューターが熟練の人間チューターに並んだ。コストは918分の1、使われたのは試験した中で最も安いモデルだった

2026年10月2日
9 min read

2026年10月2日
9 min read
AI モデルの比較の多くは、モデルに何ができるかを扱う。この研究が扱うのは、それを使った人が何を学んだかだ。前後で測定し、対照群とも、熟練の人間の教師とも比べている。創業者にとって最も役立つ結果は、教育とはまったく関係がない。
以下の内容はすべて、Handshake AI Research の Curtis Northcutt、Inaara Hasmani、Kevin Feng、Trevor Khangi、Andreas Plesner、Jonas Mueller による 「StudentBench: AI and human tutoring yield equivalent GRE learning gains」(2026年9月23日に初版公開、9月30日に改訂されたプレプリント)に基づく。匿名化されたデータは公開されている。研究に使われたチュータリングのプラットフォーム StudentBench も Handshake が運営している。第3節以降の解釈は筆者のものである。
研究では、大学院入試に使われる GRE の準備をする 2,383人の成人 を募った。大半は18〜24歳だった。各セッションは同じ構成である。
学習効果は、事後テストの得点から事前テストの得点を引いたもので、パーセントポイントで表す。人間チューターは、元 GRE 問題作成者か、5年以上の経験を持つチューターで、事後テストの問題は見られないようにした。
AI チューター全体は、GRE の学習効果で熟練の人間チューターと統計的に同等だった(p = .015、標準偏差の4分の1の範囲内)。AI と人間の平均差は −0.58パーセントポイント。どちらもチューターなしを上回り、AI チューターは対照群に比べて 6.15ポイント 上乗せした。
AI チューターのうち6つは、人間チューターとの個別の同等性検定にも合格した。GRE の7つの分野のうち5つで、最良の AI チューターが平均で人間チューターを上回った。
次にコストだ。
モデルの価格は、学生がそれでどれだけ学ぶかについて、ほとんど何も教えてくれなかった。教えてくれたのは、学習の測定だけだった。
これはチュータリングを超えて通用する教訓だ。著者たちはモデルを、ベンチマークでもトークン単価でも比べなかった。比べたのは、プロダクトが生み出すべき成果1単位あたりのコスト、ここでは学習1パーセントポイントあたりのドルである。
そう見ると、モデルの順位は変わる。1セッションあたり300倍高いモデルに価値があるのは、売っているものを300倍多く生み出す場合だけで、この研究では高価な側はそうならなかった。
多くの AI プロダクトは、その逆の順で価格を決め、作られている。チームは安心できるからという理由で高性能で高価なモデルを選び、呼び出しあたりのコストを測るが、その呼び出しがユーザーに何をもたらしたかは測らない。成果がわからなければ、20分の1の価格のモデルで同じように仕事が片づくかどうかもわからない。
見落としやすい副次的な結果が一つある。数量分野のセッションでは、AI の返答が速いほど学生のメッセージが増え、メッセージが増えるほど正しく解けた練習問題が増え、正しい練習が増えるほど学習効果が大きかった(いずれも p < .002)。
これは相関であって統制された実験ではなく、著者たちもそう示している。だが創業者が見過ごしがちな点を指している。対話型のプロダクトでは、レイテンシーは技術的な細部ではない。遅くて賢いモデルのせいで練習のやり取りが減るなら、ユーザーが学ぶもの、得るものはむしろ減るかもしれない。
創業者にとって StudentBench で最も価値があるのは、その測り方であり、その設計の大半は安く再現できる。
前と後で測る。 プロダクトが変える成果を定め、セッションの最初と最後に測る。満足度スコアやアプリ内の滞在時間は成果ではない。
AI を使わない対照群を残す。 対照群がなければ、改善のうちどれだけがプロダクトによるもので、どれだけが何もしなくても起きたのかがわからない。この研究でも、チューターなしでいくらかの改善があった。
同じユーザーでモデルを比べる。 ユーザーを2〜3のモデルに無作為に割り付け、コストだけでなく成果を比べる。同等だとわかった安いモデルは、下されるのを待っている粗利益の判断だ。
コストを成果で割る。 解決したチケット1件、正答1つ、学習1ポイントといった成果1単位あたりのコストを報告し、その数字でモデルを決める。
AI 研修を購入する、あるいは実施するチームにとって、この結果は限られた範囲で心強い。正解がはっきりしている演習型の練習 なら、AI チューターは1セッションで熟練の人間に並ぶことができ、コストはごくわずかで済む。ライブのセッションの合間の練習に AI チューターを使うのは理にかなっている。
ただし、AI が人間の教師に取って代わることを示したわけではない。研究が測ったのは1時間と直後のテストだけだ。効果が続くのか、正解のないスキルにも AI チューターが同じように効くのかは、この研究では問われていない。
これはプラットフォームを運営する企業によるプレプリントである。 Handshake AI Research は、Handshake 自身の StudentBench のサービス上でこの研究を行った。データが公開されているのは心強いが、査読は受けていない。
人間チューターの群は小さかった。 人間チューターのセッションは約140、AI は2,100超。同等性が確立されたのは AI 全体についてであり、個別の比較の裏付けはより弱い。
言語分野だけでは同等性は確立されなかった。 全体の結果は数量分野と言語分野を合わせたものだ。言語分野単独では同等性は示されず、三つの言語分野のすべてで人間チューターの平均の学習効果が最も高かった。
効果は直後のものである。 遅れて行うテストは実施されていない。1時間後に見える学習が、1か月後にも見えるとは限らない。どちらの群でも同じだ。
人間のコストは参照価格である。 4.81ドルという数字は、2018年の資料にある時給75ドルという公表価格を使っている。実際のチュータリングの価格は大きく異なるので、倍率は変わるが、方向は変わらない。
すべてのモデルの個別結果を確認したわけではない。 論文はいくつかの数字をグラフでしか示していない。筆者が使ったのは本文に記載された結果だけである。
StudentBench は、AI による指導と人間による指導の比較として、これまでで最も丁寧なものの一つだ。ランダム化され、対照群があり、熟練の人間チューターが参加し、データも公開されている。GRE の練習1時間について、AI チューターは熟練の人間と同じくらい効果があり、試験した中で最も安いモデルも人間に並んだものの一つだった。
創業者にとって、より長く通用する教訓はその方法にある。著者たちは、自分たちが重視する成果1単位あたりのコストでモデルを選び、その成果を対照群と比べて測った。その結果、0.067ドルのモデルが熟練の人間と同じ水準に並び、最も高い選択肢が選ぶべきものではないことがわかった。
価格や評判でモデルを選ぶ前に、それぞれのモデルがユーザーに実際に何をもたらすかを測り、コストをその成果で割ること。
出典:Curtis Northcutt、Inaara Hasmani、Kevin Feng、Trevor Khangi、Andreas Plesner、Jonas Mueller、「StudentBench: AI and human tutoring yield equivalent GRE learning gains」、arXiv:2609.28470、2026年9月23日の v1、9月30日の v2。2,383人の参加者、事前テスト・1時間の条件・並行版の事後テストという設計、分野ごとの13種類の AI チューター構成と熟練の人間チューター、全体の同等性の結果(p = .015)、−0.58ポイントの差、対照群に対する6.15ポイントの上乗せ、6つの個別同等性、7分野中5分野の結果、0.067ドルと21.24ドルのセッション単価、Gemma 4 31B の同等性(p = .044)と時給75ドルを基準とした1パーセントポイントあたり0.0052ドル対4.81ドル、Gemini 3.5 Flash と GPT-5.5 Pro の比較、レイテンシーと参加度の相関、各群の規模、言語分野単独の結果、記載された限界は、すべて同論文の記載どおりである。匿名化データとコード:GitHub の StudentBench。第3節から第6節の解釈は筆者のものである。狭いタスクで小さなモデルがしばしば勝つ理由についてはエージェントが LLM に尋ねることの大半は Yes か No だを、企業の AI 研修における時間の問題についてはAI 研修は2倍以上に、56%には受講する時間がないを参照。
IdeaToMVP Academy
4-week live cohort for founders. Learn to ship AI agents, scope MVPs, and automate your business — taught by the same team that writes these guides.