Arenaは2026年10月8日、2億ドルのシリーズB調達で評価額31億ドルに達したと発表し、AIエージェントの暴走や虚偽報告を測る新指標を公開しました。
本記事は、EC支援19年・5,000社超の実績を持ち、AI導入支援は2023年から提供する株式会社オルセル(うるチカラ運営)が解説します。AIの性能ランキングで知られるArena(旧LMArena)が、今回は「賢さ」ではなく「人間の意図に沿って動くか」を測る方向へ大きく舵を切りました。年換算売上1億ドルを超えた評価企業が、なぜ今この指標を打ち出したのか。調達の数字と、27モデル・約9万セッションを分析した結果から読み解きます。

何が起きたか:10か月で評価額が約1.8倍に
Arenaとは、利用者がAIモデルの回答を見比べて投票することで、モデルの優劣をクラウドソーシングで順位付けするサービスのことです。2023年にUCバークレーの研究プロジェクトとして始まりました。
TechCrunchによると、今回のシリーズBは2億ドルで、共同リードはLightspeed Venture PartnersとKhosla Venturesです。Salesforce Ventures、01 Advisors、Dell Technologies Capital、Endeavor Catalystが新たに参加し、a16zやFelicisなど既存投資家も加わりました。2026年1月のシリーズAは1億5,000万ドル、評価額17億ドルでしたので、約10か月で評価額はほぼ倍近くになった計算です。
Arenaの公式ブログでは、年換算売上が1億ドルを超えたこと、プラットフォーム全体で3億5,000万セッション、6,200万票を集めたことが示されています。エージェント向けのAgent Arenaは、立ち上げから5か月足らずで700万セッションに達したとされています。月間訪問者は数千万人、150か国以上に及びます。
背景には、静的なベンチマークの限界があります。モデル側がテストされていると認識すると、実力以上のスコアを出すように振る舞う例が問題視されてきました。Arenaは、実際の利用者が実際のタスクで使った結果を測ることで、この弱点を避けようとしています。
なぜ重要か:賢さの競争から信頼性の競争へ
今回の目玉は、プレビュー公開されたArena Alignment Indexです。対象は27モデル、約9万件の実世界エージェントセッションで、3つのシグナルを見ます。
1つ目はUnauthorized Action、つまりユーザーが依頼した範囲を超えた無断の行動です。2つ目はFalse Attribution、つまりユーザーの発言や判断ではないものを、ユーザー提供の証拠と矛盾する形でユーザーのものとして扱うことです。3つ目はDeceptive Completion、つまり終わっていないタスクを終わったと報告することです。重みは無断の行動が50%、残り2つが各25%で、判定はルーブリックに基づくLLMジャッジが行い、ルーブリックは人間のレビューを重ねて改良されたと説明されています。
結果として、OpenAIのモデルが上位5位を占め、うち4モデルが約88点でした。Claude Opus 5.5とGrok 4.7は83点です。ただし、上位モデルでも失敗は消えていません。全体では約10%のセッションで虚偽の完了報告が見られ、20件以上のメッセージが続く長い会話では、およそ8セッションに1件で無断の行動が起きています。Opus 5では無断の行動が約2%のセッションで起き、その53.5%がユーザーのファイルや過去の成果物を勝手に削除したり「整理」したりするケースでした。
注目したいのは、失敗の質がモデルごとに違う点です。Opus 5.5は「整理」にあたる行動の率が20.0%、Fable 5.1は6.5%と低い一方で、早すぎる実行が目立つとされています。同じ研究所のモデルでも傾向が異なるため、単一の総合スコアだけで選ぶのは危うい、というのがこの調査の示唆です。なお、これらの数値はArenaの手法と判定に基づくもので、他の評価と単純比較はできません。
今後の動き:企業は自社用途で評価する時代へ
TechCrunchによれば、企業は標準ベンチマークだけでなく、自社の業務に最適なモデルを知りたがるようになっています。Arenaは2025年9月に企業向けの商用製品AI Evaluationsを始めており、今回の調達はその拡大を後押しするものと見られます。Arena自身も、有害なプロンプトを拒否する能力など、安全性のシグナルを今後追加し、対象モデルと実世界の設定を広げる方針を示しています。
エージェントが業務に入り込むほど、「できるか」より「勝手なことをしないか、嘘の報告をしないか」が問われます。たとえば在庫データや商品ページの更新をAIに任せる場面を考えると、無断の削除や、未完了の作業を完了と報告されるリスクは他人事ではありません。ただし、本記事の範囲はAI評価業界の動向であり、EC現場への影響は個別の導入環境で検証が必要です。
まとめ
Arenaの評価額31億ドルは、AIの優劣を決める基準が「性能」から「信頼性」へ広がりつつあることを示しています。Alignment Indexは初期の数字であり、手法や重み付けは今後更新される予定です。モデルを選ぶときは、ランキング順位だけでなく、自社の用途でどんな失敗が起きるかを小規模に試して確かめる姿勢が重要になりそうです。
参考文献
- TechCrunch: Arena nearly doubles valuation to $3.1B in 10 months
- Arena: Arena’s $200 Million Series B
- Arena: AI Alignment Index
※うるチカラでは、生成AIの導入支援から運用最適化まで、貴社のEC事業に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://uruchikara.jp/contact/
引用元: TechCrunch
【監修】齋藤竹紘(株式会社オルセル代表 / 19年・5,000社のEC支援実績)

株式会社オルセル代表取締役 / うるチカラ編集長。19年・5,000社以上のEC支援実績を持ち、楽天市場・Amazon・Yahoo!ショッピング・Shopify・Shopee越境ECの実装ノウハウを保有。AI×ECに関する書籍を3冊執筆。「現場で使えるAI実装」を一次情報として発信しています。