Liquid AIは2026年10月7日、テキスト・画像・音声で判断を下すエッジ向けのオープンウェイトモデル「d1-3B」と「d1-omni-600M」を公開しました。
本記事は、EC支援19年・5,000社超の実績を持ち、AI導入支援は2023年から提供する株式会社オルセル(うるチカラ運営)が解説します。Liquid AIが公開した決定モデル(Decision Model)とは、文章を生成せず、与えられた質問に対して「はい・いいえ」「選択肢のどれか」「点数」といった判断だけを1回の計算で返すAIモデルのことです。Hugging Faceのブログによると、同社の評価指標「Decision Index 0.2.1」で、d1-3Bは10B未満のモデルの中で最高となる48.57点を記録しました。
何が起きたか 2つのモデルと48.57点のスコア
結論から言うと、今回の公開は「判断に特化した小さなAIを、手元の機器で動かせる形で配る」という発表です。公開されたのは、テキストと画像に対応するd1-3Bと、テキストと画像、またはテキストと音声に対応する実験的モデルd1-omni-600Mの2つです。d1-3BはLFM2.5-VL-3Bという画像対応のモデルをもとに学習され、d1-omni-600MはLFM2.5-Encoder-350Mという双方向エンコーダーに視覚と音声の入り口を足して作られています。
決定モデルの最大の特徴は、文章を一文字ずつ生成せず、1回のフォワードパス(入力から出力までを一度だけ計算する処理)で答えを出す点です。Liquid AIの記事では、Decision Index 0.2.1でd1-3Bが48.57点となり、4Bや9Bクラスのモデルをすべて上回り、35B-A3B規模のDecider(47.11点)も超えたと説明されています。7つのデータセットの平均では、d1-3Bが82.9、d1-omni-600Mが78.4でした。なお、これらは開発元自身の評価結果であり、第三者による再現は確認できていないため、数字は参考値として見るのが安全です。
速度面の数字も具体的です。d1-3Bが1つの質問に答えるまでの時間は、NVIDIA RTX 4090で8ms、AMD MI325Xで9ms、組み込み向けのJetson AGX Thorで16ms、Jetson AGX Orinで26ms、Jetson Orin Nanoで50msと報告されています。Apple M5 Proでも30msです。1秒に何十回も判断できる速度であり、クラウドに問い合わせずに端末側で判断を完結できる水準といえます。
なぜ重要か 生成AIの使い方が「書かせる」から「判定させる」へ広がる
今回の発表が示すのは、生成AIの用途が文章作成だけでなく、大量の仕分けや判定にも広がっていることです。決定モデルは、分類、スコアリング、選択といった作業を、文章生成モデルよりも小さく速く処理することを狙っています。ベンチマークにはSQuAD 2.0(質問応答)、Civil Comments(不適切な書き込みの判定)、MASSIVE(意図の分類)、PubMedQA、BoolQ、XNLI、PAWS-Xが使われており、いずれも「答えが決まった形で返る」タスクです。
小さなモデルの価値は、コストと遅延にあります。d1-omni-600Mはパラメータ数が約4分の1でありながら、Decider 2Bの平均77.1を上回る78.4を出したとされています。モデルが小さければ、クラウドの利用料を抑えやすく、通信を挟まないぶん応答も速くなります。一方で、Liquid AIの記事では視覚の公開ベンチマークは提示されておらず、音声の決定ベンチマークは未解決の課題とされています。画像や音声での実力は、現時点では公式の数字だけで判断できない部分が残ります。
また、記事は両モデルを「open-weight(学習済みの重みが公開されている)」と説明していますが、ライセンスの名称や商用利用の条件は確認できませんでした。業務で使う場合は、モデルページで条件を確認することが必須で、現時点では要確認です。
日本の現場で考えられる使いどころ
今回のニュースはAI業界の技術動向であり、EC事業者の業務に直接結びつく発表ではありません。そのうえで、判定系の作業が多い現場にとって、小型の決定モデルは選択肢の一つになりえます。たとえば、レビューやお問い合わせの内容を「要対応・不要」に振り分ける、商品画像が掲載基準を満たしているかを確認する、といった作業は、文章を書かせるよりも判定をさせるほうが向いています。ただし、d1が日本語でどの程度の精度を出すかは今回の記事からは確認できず、日本語データでの検証が前提になります。
今後の動き 注目したい3つのポイント
第一に、ライセンスと商用利用の条件です。モデルページで条件が明確になるまで、業務への組み込みは慎重に見るべきです。第二に、日本語を含む多言語での性能です。公開されたベンチマークはXNLIやPAWS-Xなど一部に多言語データを含みますが、日本語の業務データでの結果は別に確かめる必要があります。第三に、画像と音声の評価です。視覚の公開ベンチマークが示されていないため、今後の追加評価や第三者の検証が待たれます。
導入を検討する場合は、まず少量の自社データで判定精度と処理時間を測り、既存の仕組みと比べて差が出るかを確認する進め方が現実的です。Hugging FaceのSystem One Arcadeというデモ空間も案内されており、動作の感触をつかむ入り口になります。
まとめ
Liquid AIは、判断に特化したオープンウェイトモデルd1-3Bとd1-omni-600Mを公開しました。d1-3Bは10B未満で最高の48.57点を記録し、Jetson AGX Thorで16msという応答速度が報告されています。数字は開発元の評価であり、ライセンスや日本語性能は要確認ですが、「小さく速く判定するAI」という方向性は今後も注目に値します。
参考文献
- Liquid AI:Open d1 Edge decision models for text, vision, and audio(Hugging Face Blog)
- Liquid AI:d1 Decision Model
- LiquidAI/d1-3b(Hugging Face)
- LiquidAI/d1-omni-600M(Hugging Face)
※うるチカラでは、生成AIの導入支援から運用最適化まで、貴社のEC事業に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://uruchikara.jp/contact/
引用元: Hugging Face Blog(Liquid AI)
【監修】齋藤竹紘(株式会社オルセル代表 / 19年・5,000社のEC支援実績)

株式会社オルセル代表取締役 / うるチカラ編集長。19年・5,000社以上のEC支援実績を持ち、楽天市場・Amazon・Yahoo!ショッピング・Shopify・Shopee越境ECの実装ノウハウを保有。AI×ECに関する書籍を3冊執筆。「現場で使えるAI実装」を一次情報として発信しています。