MicrosoftのThinkingBox公開、507タスクで測るAIエージェントの信頼性

MicrosoftとHugging Faceが公開したAIエージェント評価ベンチマークThinkingBoxを解説。507タスク×20回の結果、20回連続成功の差、失敗の79.9%がツール起因という数字を整理します。

投稿日: カテゴリー AIニュース

MicrosoftとHugging Faceは2026年10月3日、AIエージェントの業務信頼性を507タスク×各20回の実行で測るベンチマーク「ThinkingBox」を公開しました。

本記事は、EC支援19年・5,000社超の実績を持ち、AI導入支援は2023年から提供する株式会社オルセル(うるチカラ運営)が解説します。ThinkingBoxとは、AIエージェントが業務を終えた時点のデータベースの状態と副作用を採点し、ツールを正しく呼べたかではなく、結果が本当に正しかったかを測るベンチマークのことです。Hugging Faceのブログをもとに、何が測られ、どのモデルがどう評価されたのかを整理します。

何が公開されたのか:状態の正しさで採点する新ベンチマーク

ThinkingBoxは、Microsoftの研究者とHugging Faceのメンバーが共同で開発しました。ブログによると、評価対象は507個の業務タスクで、各タスクを20回ずつ繰り返し実行します。エージェントは隔離されたMCPツールセッションの中で動き、終了時のバックエンドの状態と副作用が採点されます。MCPとは、AIが外部のツールやデータにつながるための共通規格のことです。

タスクの業務ドメインは5つあり、小売が98件、自動車保険が100件、旅行が104件、ネオバンクが104件、コンサルティングが101件です。評価環境はOpenEnvのインターフェースから使えます。ライセンスは、コードがMIT、ベンチマークデータがCDLA-Permissive-2.0、OpenEnv用の環境がBSD-3-Clauseと記載されています。強化学習用のリポジトリも近日公開と案内されています。

数字で見る結果:1回の成功率と20回連続成功の差

ブログの主要結果では、1回実行の成功率(pass@1)はClaude Opus 5.5が67.16%で、Claude Opus 5が66.50%、GPT-5.4が65.36%、Kimi-K3が57.37%でした。ところが20回すべてで成功したタスク数を見ると、Claude Opus 5.5とClaude Opus 5が241件、GPT-5.4が128件、Kimi-K3が68件と、差が大きく開きます。507タスク中241件は約47.5%にあたります。

つまり、1回の成功率が近いモデル同士でも、毎回安定して成功できるかどうかは別の話です。ブログはKimi-K3について、少なくとも1回は成功したタスクが93.89%と幅広さでは最強である一方、20回すべて成功したのは13.41%にとどまると述べています。業務に組み込む場合は、たまたま成功する確率よりも、同じ作業を毎回正しくこなせる確率のほうが重要になります。

なぜ重要か:失敗の約8割はツールの扱い

失敗の内訳も参考になります。ブログによると、失敗の79.9%はツールの使い方、10.3%は誤った状態更新、7.0%はユーザーの依頼を最後まで解決できなかったケース、2.9%は状態を変える操作を何もしなかったケースでした。モデルの知識や会話力よりも、ツールを正しく操作する力が信頼性を左右している形です。

コストの見方も示されています。ブログは、20回連続で成功するタスク1件あたりの最低コストをGPT-5.4の6.80ドルとしています。1回の成功あたりで最も安いモデルは0.127ドルでしたが、安定して成功させる前提では9.76ドルになり、1回の成功が安いことと信頼性が安いことは別だと指摘しています。モデル選定でトークン単価だけを比べる危うさを示す結果です。なお、これらはベンチマーク上の数値であり、個々の現場にそのまま当てはまるとは限りません。

今後の動き:注目したい3つのポイント

第一に、強化学習用のリポジトリが公開された後、ツール操作の失敗がどこまで減るかです。失敗の約8割がツール関連なので、改善の余地も大きい領域といえます。第二に、他社が同様の状態検証型の評価を採用するかどうかです。第三に、各モデル提供元が、20回連続成功といった一貫性の指標を公式の比較資料に載せるかどうかです。

小売を含む業務でAIエージェントに受注や在庫、問い合わせ対応を任せることを考える事業者にとっても、導入前に自社の業務で複数回試し、毎回結果が揃うかを確認する発想は参考になります。日本のモール運営に直接結びつく公式の評価結果は今回のブログからは確認できず、要確認です。

まとめ

ThinkingBoxは、業務の結果としての状態を採点し、507タスクを各20回実行することで、AIエージェントの一貫性を測る仕組みです。1回の成功率が近くても、20回連続成功の数には大きな差があり、失敗の79.9%はツールの扱いが原因でした。エージェントを業務に使うなら、1回の精度ではなく、繰り返しても安定するかを基準に見ておくと安心です。

参考文献

※うるチカラでは、生成AIの導入支援から運用最適化まで、貴社のEC事業に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://uruchikara.jp/contact/

引用元: Hugging Face Blog


【監修】齋藤竹紘(株式会社オルセル代表 / 19年・5,000社のEC支援実績)


投稿者: 齋藤竹紘

株式会社オルセル代表取締役 / うるチカラ編集長。19年・5,000社以上のEC支援実績を持ち、楽天市場・Amazon・Yahoo!ショッピング・Shopify・Shopee越境ECの実装ノウハウを保有。AI×ECに関する書籍を3冊執筆。「現場で使えるAI実装」を一次情報として発信しています。

お問い合わせ