DeepSeekは2026年9月10日、長いコンテキスト、ツール利用、マルチモーダル入力を想定したAPIモデルとしてDeepSeek V4.1 Flashを発表した。公式説明では総パラメータ552BのMixture-of-Experts(MoE)を採用し、プレフィル時は約8B、デコード時は約16Bがアクティブになる。ネイティブ視覚理解も備える。研究上の名称だけでなくAPIは提供中で、開発者は公式入口から実リクエストを試せる。

今回、何が公開されたのか

製品の中心は、テキストと画像の理解を一つのAPIワークフローに置くことだ。アプリは文書、画面、グラフ、写真を質問と一緒に送れ、毎回別サービスで変換する必要が減る。長いコンテキスト、エージェント処理、ツール呼び出しも設計の柱だが、実際の利用範囲はエンドポイント、アカウント、文書化された制限に左右される。

MoEを採用しても、すべてのリクエストで552B全体が動くわけではない。DeepSeekが示すアクティブパラメータは、大規模モデルの容量とリクエスト単位の計算量を両立させる設計を示すものだ。どの端末、プロンプト、ワークロードでも同じ速度になるわけではなく、品質はタスク、入力形式、サービス側のスケジューリングにも依存する。

Flashの核心は効率とメモリ

DeepSeekはV4.1 FlashのKVキャッシュを強調している。従来の構成と比べ、キャッシュ使用量をHBMで約4分の1、SSDで約8分の1にできるとしている。限られたアクセラレータメモリで長いコンテキストを提供しやすくする狙いで、導入コスト、同時処理数、大量文書や長い対話でのモデル選択に影響する。

だから「552B」だけでは高価か安価かは判断できない。総パラメータは容量を示し、アクティブパラメータとキャッシュ構成のほうがリクエスト処理時の計算・メモリコストに近い。企業はトークン単価、入出力比率、遅延、スループット、データの処理場所を同じ表で比較する必要がある。

APIは提供中だが料金とルーティングに注意

DeepSeekはV4.1 FlashのAPI入口と新料金を公開し、開発者はモデルのダウンロードや限定キューを待たずに試せるようになった。さらにV4.1 Proの提供前は、9月14日04:00 UTCからV4 Proへのリクエストを一時的にV4.1 Flashへ送り、Flash料金を適用すると説明している。これはサービス上のルーティングであり、ProとFlashが完全に同じという意味ではない。

PoCを作るチームにとって重要なのはニュースのモデル名だけではない。APIドキュメントのコンテキスト上限、画像形式、レート制限、データ保持方針、地域別提供を実際に確認すべきだ。発表で「利用可能」と書かれていても、すべてのアカウント、地域、SDKが同じ日に同じ機能を持つとは限らない。

開発者にとっての意味

V4.1 Flashは、長いコンテキストと画像理解を必要としながら推論コストを抑えたいワークフローに向く。技術文書のQ&A、可視化レポートの整理、問い合わせの振り分け、画像対応エージェントなどだ。専用視覚モデルを自動的に置き換えるものでも、すべての推論で他モデルを上回る保証でもないため、自社データでのA/Bテストが有効だ。

今回注目すべきなのは、モデル能力、メモリ効率、APIの事業条件が一つの製品更新にまとまった点だ。IAMの読者にとっての判断基準は最大のパラメータ数ではなく、自分のデータ、遅延、予算で仕事を安定して完了できるかどうかになる。

DeepSeek V4.1 Flashの公式説明を見る