Ai2は2026年7月末から、GPU時間の予算とスケジューリング契約を組み合わせた新方式を導入し、デバッグジョブのp90待ち時間を約2時間から30秒に縮めました。
本記事は、EC支援19年・5,000社超の実績を持ち、AI導入支援は2023年から提供する株式会社オルセル(うるチカラ運営)が解説します。AI開発の現場では、モデルの性能だけでなく、高価なGPUをどう分け合うかという運用設計が成果を左右します。Hugging Faceのブログで、Ai2のAIインフラチームが公開したGPUクラスタのスケジューリング改善は、その好例です。

Ai2が公開したGPUスケジューリング改善の中身
GPUスケジューリングとは、限られたGPU計算資源を、どの研究者のどのジョブにいつ割り当てるかを決める仕組みのことです。Hugging Faceのブログ記事によると、Ai2のクラスタは88基から1024基のGPUで構成され、H100、B200、B300を数千基規模で運用しています。利用者は約150名の研究者で、需要は供給の2倍から3倍に達しているとのことです。
従来は優先度ベースのスケジューラを使っていましたが、ジョブがGPUを抱え込み続ける占有、優先度の水増し、オンコール対応の増加といった問題が起きていました。そこでAi2は、可用性、占有率、インパクト、利用率を積み上げる4段のピラミッドで目標を整理し、新方式に置き換えました。
新方式の柱は三つあります。一つ目はGPU時間予算で、予算は管理職が決め、配分を事前に透明な形で示します。二つ目は階層的なフェアシェアで、直近7日間のスライディングウィンドウで各チームの占有を追跡します。三つ目はスケジューリング契約で、ジョブが最低実行時間(上限8時間)を宣言すると、その間はプリエンプション、つまり他のジョブによる強制的な中断から保護されます。予算の対象外となる非割当の占有枠も残してあり、GPUの稼働率を落とさない工夫がされています。
30日間のテストで出た数字をどう読むか
2026年7月末から段階的に展開し、30日間のテスト期間で次の結果が出ています。配分されるべきGPU時間の98%を提供でき、15チーム中13チームが95%以上を受け取り、最低のチームでも90%でした。稼働率は変更の前後とも98%で、配分外に割り当てられたGPU時間は18%です。人手を要する修理は74%減りました。
最も目を引くのは待ち時間です。デバッグジョブのp90待ち時間は2時間から30秒になりました。p90とは、全体の90%のジョブがそれ以内に始まる待ち時間のことです。なお、事前のシミュレーションでは約6時間から5分への短縮を予測していたと説明されています。最大のH100クラスタでは、中央値の待ち時間が5分から24秒、p90が2.8時間から1.8時間に改善しました。稼働率を保ったまま待ち時間を縮めた点が重要です。
残された課題と今後の動き
Ai2自身も課題を挙げています。対話型セッションが保護時間の上限で中断されてしまう問題があり、対応としてCPUのみのクラスタとセッション復元機能を開発中です。大規模ジョブで起きる容量の断片化も調査中とされています。今後はブートストラップ、チェックポイント、学習アプリケーションの効率化を通じて、利用率そのものを引き上げる方針です。
この事例が示すのは、GPUの台数を増やす前に、配分のルールを見直す余地が大きいということです。優先度を声の大きさで決める運用は、占有や水増しを生みやすくなります。時間予算と事前宣言という透明なルールにすることで、利用者の側も計画を立てやすくなります。生成AIの社内活用で、APIの利用枠や推論基盤を複数チームで共有している企業にとっても、配分設計を先に決める発想は参考になるはずです。
まとめ
Ai2のGPUスケジューリング改善は、予算、フェアシェア、契約の三層で、稼働率98%を保ったままデバッグジョブのp90待ち時間を約2時間から30秒に縮め、人手の修理を74%減らしました。計算資源の運用は、モデル開発のスピードを決める競争力の一部です。続報や詳細な設計は、元の公式ブログで確認してください。
参考文献
- Hugging Face Blog: Impactful scheduling for GPU clusters(Ai2)
- Dominant Resource Fairness(Ghodsi et al., 2011)
- SLURM Fair Tree(SchedMD)
- Hadoop YARN Fair Scheduler(Apache)
※うるチカラでは、生成AIの導入支援から運用最適化まで、貴社のEC事業に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://uruchikara.jp/contact/
引用元: Hugging Face Blog
【監修】齋藤竹紘(株式会社オルセル代表 / 19年・5,000社のEC支援実績)

株式会社オルセル代表取締役 / うるチカラ編集長。19年・5,000社以上のEC支援実績を持ち、楽天市場・Amazon・Yahoo!ショッピング・Shopify・Shopee越境ECの実装ノウハウを保有。AI×ECに関する書籍を3冊執筆。「現場で使えるAI実装」を一次情報として発信しています。