ローカル実行可能で画像入力もOKな意思決定モデル「d1-3B」と音声入力も可能な「d1-omni-600M」が登場、OpenAIのDecisions APIより高速実行

AI開発企業のLiquid AIが意思決定モデル「d1-3B」と「d1-omni-600M」をリリースしました。無料でダウンロードしてローカルで実行できます。
Open d1: Edge decision models for text, vision, and audio | Blog | Liquid AI
https://www.liquid.ai/blog/d1-open
2026年9月に「Jev」が発表されたことを皮切りに同様の機能を持った意思決定モデルが次々と登場しています。意思決定モデルは「あらかじめ複数の選択肢を用意しておき、質問に対して適切な選択肢を信頼度スコア付きで選び出す」という処理が可能。「目的にあったAIモデルを選ぶ」「大量のウェブサイトを複数のカテゴリに分類する」といったタスクに適しており、LLMと比べて高速かつ低コストで実行できることから大きな注目を集めています。
d1-3Bとd1-omni-600MはLiquid AIが2026年9月末にリリースした「d1」のオープンモデル版という位置付けです。
d1-3Bは視覚言語モデル「LFM2.5-VL-3B」をベースに意思決定モデルとしてトレーニングされたパラメーター数31億2000万のモデルで、テキストと画像の入力に対応しています。
d1-omni-600Mはエンコーダーモデルの「LFM2.5-Encoder-350M」をベースにトレーニングされたパラメーター数5億8700万の意思決定モデルで、テキストと画像だけでなく音声の入力にも対応しています。
各種意思決定モデルの性能を示したグラフが以下。横軸がパラメーター数(モデルの規模)、縦軸がベンチマークスコアを示しています。d1-3Bとd1-omni-600Mはd1やJevには劣る性能ですが、同一規模のオープンモデルと比べて最も高い性能を備えています。
インターネット上にはd1-3Bの動作報告が複数投稿されています。以下のユーザーは「GeForce RTX 3060(VRAM 12GB)でd1-3Bを実行した結果、1回の決定処理を25ミリ秒、3個の質問を38ミリ秒、640×480ピクセルの画像を含む処理を146ミリ秒で実行でき、ピークVRAM使用量は6GBだった」と報告しています。
— Doğukan (@DogukanUrker) October 7, 2026running d1-3B on a single RTX 3060 12GB, via the official transformers path (bf16, no torch.compile):
25 ms for one decision. 38 ms for 3 questions over the same state in one pass. 146 ms with a 640x480 image. ~6 GB VRAM.
for reference Liquid's card puts the 4090 at 16 ms… https://t.co/TtpsiP07Nv pic.twitter.com/0cou17qnga
また、以下のユーザーは「GeForce RTX 3090でd1-3Bを実行した結果、OpenAIのDecisions APIよりはるかに高速な処理が可能だった」と報告しています。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.


