TIIは2026年10月、アラビア語向けの16億パラメータの音声認識モデル「Falcon-ASR」を公開しました。
アラビア語の音声認識で、アブダビの研究機関TIIが新モデルを出しました。本記事は、EC支援19年・5,000社超の実績を持ち、AI導入支援は2023年から提供する株式会社オルセル(うるチカラ運営)が解説します。Hugging Faceのブログによると、Falcon-ASRはパラメータ数16億で、アラビア語の平均WER(単語誤り率)は20.92%です。比較対象の最良公開結果は23.17%で、2.25ポイントの改善とされています。

何が起きたか:Falcon-ASRとは何か
Falcon-ASRとは、Technology Innovation Institute(TII)が公開した、アラビア語を主対象とする音声認識モデルのことです。パラメータ数は16億で、基盤はTIIの音声言語モデル系列であるFalcon3-Audioです。アラビア語に加えて英語、フランス語、スペイン語、ポルトガル語に対応し、言語を指定するフラグは不要とされています。単語単位のタイムスタンプ付きで文字起こしができる点も特徴です。
性能面では、6つのテストセットでのアラビア語平均WERが20.92%でした。リーダーボードを確認した2026年9月30日時点で、比較対象の最良公開結果23.17%を下回っています。WERは、認識結果の中で誤っている単語の割合を示す指標で、低いほど正確です。さらに、TIIの内部評価によるエミラティ方言(UAEの話し言葉)ではWER 22.73%、CER(文字誤り率)10.19%で、比較したシステムの中で最も低い値だったと説明されています。次点とされるQwen3-OmniよりWERで4.07ポイント低い結果です。英語についても、Hugging FaceのOpen ASR Leaderboardにある公開テストセット7種の平均でWER 5.74%と報告されています。

学習データは、エミラティ方言、現代標準アラビア語、その他の湾岸方言とアラビア方言、英語です。実環境を想定して、背景雑音、話者の声の重なり、音楽、残響、電話回線の効果、速度や音程の変化を加えたデータ拡張も行ったと書かれています。提供状況は、試用できるデモ用Spaceが公開されており、APIとネイティブアプリは計画段階です。デモは最大60秒の音声クリップが対象です。ライセンスは元記事に記載がなく、要確認です。
なぜ重要か:方言に強い音声認識という方向性
結論として、このニュースの価値は、方言を主戦場に据えた音声認識モデルが、汎用の大型モデルを上回ったと主張している点にあります。標準語向けの精度が高くても、地域の話し言葉では認識が崩れることは、日本語の方言や早口の会話でも起こる課題です。Falcon-ASRは、エミラティ方言という限られた領域に学習を寄せ、内部評価で最良値を出したとしています。
ただし、数字の読み方には注意が必要です。エミラティ方言の評価はTII内部評価であり、第三者による再現結果ではありません。リーダーボードの値も2026年9月30日時点のスナップショットで、順位は今後入れ替わる可能性があります。20.92%というWERも、5語に1語弱は誤るという水準で、字幕や議事録にそのまま使うには人の確認が前提になります。精度の改善幅が2.25ポイントである点も、過大評価しないほうがよいでしょう。
関連して、TIIは同時期にFalcon-Emiratiと、2億7,000万パラメータのアラビア語OCRモデルも公開しています。文字起こしと文字認識を、小さめのモデルで地域言語向けに揃えていく流れが読み取れます。大規模な汎用モデル一本ではなく、言語や用途ごとに軽量モデルを使い分ける設計が、公開モデルの世界で広がっていることがうかがえます。

今後の動き:日本の事業者が見ておく点
今後の注目点は三つあります。一つ目は、APIとネイティブアプリが計画どおり提供されるかです。現時点では60秒までのデモしかなく、実務での検証はまだ難しい段階です。二つ目は、ライセンス条件の公開です。商用利用できるかどうかで、企業が検討できる範囲が大きく変わります。三つ目は、第三者によるエミラティ方言以外での再現報告です。
日本のEC事業者にとって、このモデルが直接役立つ場面はまだ限られます。ただし、中東向けの越境ECや、アラビア語圏の顧客との通話・問い合わせ音声を扱う場合には、文字起こしの選択肢が増える可能性があります。そのほか、日本語の方言や業界用語に強い音声認識を選ぶ際に、特化型モデルを比較する考え方が参考になります。AI音声認識を導入する場合は、まず自社の通話音声の一部で誤り率を測り、人の確認工程を含めて運用を設計するのが現実的です。
まとめ
Falcon-ASRは、アラビア語平均WER 20.92%、エミラティ方言でWER 22.73%という数字を掲げ、方言特化型の音声認識モデルとして登場しました。内部評価やリーダーボードのスナップショットに基づく結果である点を踏まえつつ、API提供とライセンスの公開、第三者の検証を待つのが妥当です。特化型の小型モデルが各言語で伸びている流れとして、今後も注目したいニュースです。
参考文献
- Hugging Face: Introducing Falcon ASR(TII)
- arXiv: Falcon3-Audio関連論文(2509.07526)
- Hugging Face: Open ASR Leaderboard
※うるチカラでは、生成AIの導入支援から運用最適化まで、貴社のEC事業に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://uruchikara.jp/contact/
引用元: Hugging Face
【監修】齋藤竹紘(株式会社オルセル代表 / 19年・5,000社のEC支援実績)

株式会社オルセル代表取締役 / うるチカラ編集長。19年・5,000社以上のEC支援実績を持ち、楽天市場・Amazon・Yahoo!ショッピング・Shopify・Shopee越境ECの実装ノウハウを保有。AI×ECに関する書籍を3冊執筆。「現場で使えるAI実装」を一次情報として発信しています。