📑 目次
中国のAI開発企業DeepSeekが2026年9月10日、新モデル「DeepSeek-V4.1-Flash」を発表した。VentureBeatによると、最大の特徴は、閑散時間帯であれば100万トークンあたりキャッシュ入力0.003ドルという破格の価格設定だ。同時に、コーディング能力を測るとみられるベンチマーク「DeepSWE v1.1」でClaude Opus 5やGPT-5.6 Solを上回るスコアを記録した一方、実務タスク遂行力を測るとみられる「Terminal-Bench 3.0」ではClaude Opus 5に及ばなかった。価格と性能のどちらを取るかという二択を、企業のAI導入担当者に突きつける発表になった。
DeepSeek V4.1-Flashとは何か
DeepSeek-V4.1-Flashは、DeepSeekが2026年9月10日に発表した大規模言語モデルだ。VentureBeatの報道によれば、既存の「V4-Flash」と「V4-Pro」という2つのモデル識別子は、今後このV4.1-Flashへ自動的にルーティングされる予定だ。特にV4-Proについては2026年9月14日以降、リクエストが新モデルへ切り替わるとされる。利用者が明示的にモデルを選び直さなくても、裏側では新しいモデルに置き換わっていく設計になっている。
提供方法は2系統ある。ひとつはDeepSeekが提供するプラットフォーム経由のAPIアクセスであり、もうひとつはHugging Face上で公開されるオープンウェイトだ。オープンウェイト版はMITライセンスの下で配布され、商用利用も認められている。企業が自社サーバーに持ち込んで使う選択肢と、APIで手軽に呼び出す選択肢の両方が用意された形だ。
価格はオフピークで1トークンあたり0.003ドル
今回の発表で最も目を引くのが価格設定である。DeepSeek-V4.1-Flashは、100万トークンあたりの処理料金を時間帯によって2段階に分けている。VentureBeatによれば、平日のUTC午前1時から4時、および午前6時から10時をピーク時間帯と定め、それ以外はオフピーク時間帯として扱う。
オフピーク時間帯の料金は、キャッシュされた入力トークンが100万あたり0.003ドル、キャッシュされていない入力トークンが0.15ドル、出力トークンが0.60ドルだ。VentureBeatによると、ピーク時間帯はこの2倍の料金が適用され、キャッシュ入力0.006ドル、非キャッシュ入力0.30ドル、出力1.20ドルとなる。同じ処理内容でも呼び出す時間帯次第でコストが2倍変わる計算だ。企業が大量のバッチ処理を回す場合、深夜から早朝のオフピーク帯に処理を寄せるだけで、コストを半分に抑えられることになる。
552億パラメータのMoE構造とEngramメモリ
価格の安さを支えるのが、モデル内部の構造上の工夫だ。DeepSeek-V4.1-Flashのバックボーンは552億パラメータのMixture-of-Experts(専門家混合)構造を採用している。VentureBeatの報道によれば、実際に計算へ使われる活性化パラメータ数は、入力を読み込むプリフィル時で8B(80億)、文章を生成する際は16B(160億)にとどまる。全パラメータのうち一部だけを動かすことで、計算コストを抑える設計だ。
もうひとつの特徴が、40層のTransformerを20層ずつ2つに分割した「Causal Encoder-Decoder」という構成である。これに加えて、196億パラメータの「Engram条件付きメモリ」と呼ばれる追加モジュールを組み込んでいる。VentureBeatによれば、KVキャッシュ(会話の文脈を保持するための一時データ)のサイズはトークンあたり890バイトで、前世代のV4-Flashの約4分の1に圧縮されたという。圧縮には「Compressed Sparse Attention 2」「階層スパースインデックス」「FP4 KVキャッシング」といった技術が使われている。文脈を保持したまま計算コストとメモリ使用量を切り詰める設計思想が、そのまま安価な料金体系に直結している格好だ。
コンテキストウィンドウ(一度に読み込める文章量)は100万トークンに達し、画像を直接読み込むネイティブビジョン機能にも対応する。加えて、グローバルなKVキャッシュは最低72時間保持されることが保証されており、長時間にわたる対話や大量の資料を扱う業務用途でも文脈が失われにくい。
ベンチマークで見るDeepSeek V4.1-FlashとClaude Opus 5の差
性能面では、複数のベンチマークで他社の主要モデルと比較されている。コーディング能力を測るとみられる「DeepSWE v1.1」で、DeepSeek-V4.1-Flashは74.2のスコアを記録した。VentureBeatによると、これはAnthropicの「Claude Opus 5」の74.0、OpenAI系とみられる「GPT-5.6 Sol」の73.0をわずかに上回る数字だ。
一方で、実務的なタスク遂行力を測るとみられる「Terminal-Bench 3.0」では明暗が分かれた。DeepSeek-V4.1-Flashのスコアは31.2にとどまり、Claude Opus 5の43.3を大きく下回っている。VentureBeatの報道では、このほかセキュリティ関連の実力を測るとみられる「CyberGym」で88.1、自動化タスクの遂行力を測るとみられる「AutomationBench」で54.8というスコアも公表されている。コーディングの精度では僅差でリードしても、実際の作業環境でタスクをこなす力ではClaude Opus 5との差が開くという結果だ。
ベンチマークの数値だけを見れば、DeepSeek-V4.1-Flashは特定領域でトップクラスのモデルに肉薄しているものの、あらゆる指標で優位に立っているわけではない。得意分野と不得意分野がはっきり分かれている点は、導入を検討する企業にとって見落とせないポイントだ。
ビジネスへの影響 ー 低コストAPIが変える競争環境
DeepSeek-V4.1-Flashの登場が示すのは、高性能モデルの価格競争がさらに一段進んだという事実だ。100万トークンあたり0.003ドルという水準は、AIをコールセンターの応答支援やドキュメント要約、社内チャットボットといった大量処理が必要な業務に組み込む際のコスト障壁を大きく下げる。これまでコストを理由にAI導入を見送っていた中小企業にとっても、選択肢に入りやすくなる価格帯だ。
一方で、Terminal-Bench 3.0のように実務遂行力で他社モデルに劣る指標がある以上、安いからといってすべての用途をこれに置き換えるという判断は早計になりかねない。定型的な大量処理には向いていても、複雑な手順を伴う自動化タスクには不向きな可能性がある。企業のAI活用担当者には、処理の性質ごとに複数モデルを使い分ける発想が求められる。実際、直近ではClaude Fable 5.1がキャッシュ料金を75%引き下げたように、主要各社が同時多発的に価格を下げており、モデル選定の基準が性能だけでなく用途別の費用対効果に移りつつある。
オープンウェイト版がMITライセンスで商用利用可能な点も見逃せない。自社インフラにモデルを持ち込みたい企業や、API経由の従量課金を避けたい開発者にとって選択肢が広がる。Alibabaの「Qwen3.8-27B」がローカル環境で動作する事例のように、オープンウェイトモデルをローカルで運用する動きは他社でも進んでおり、DeepSeek-V4.1-Flashもその潮流に加わった形だ。
今後の展望とV4-Pro移行の注意点
今回の発表で実務上とりわけ注意が必要なのは、既存モデルからの自動的な切り替えだ。2026年9月14日以降、V4-Proへのリクエストは利用者が設定を変更しなくてもDeepSeek-V4.1-Flashへルーティングされる。VentureBeatの報道が事実であれば、既存のシステムに組み込んでいる企業は、モデルの切り替えによって出力の傾向や応答速度が変化する可能性を織り込んでおく必要がある。
価格とベンチマークの両面で存在感を示したDeepSeek-V4.1-Flashだが、公表されているのは限られた指標にとどまる。実際の業務でどの程度の性能を発揮するかは、各社が自社のユースケースで検証していく段階にある。
まとめ
DeepSeek-V4.1-Flashは、圧倒的な低価格とコーディング系ベンチマークでの高スコアを武器にする一方、実務タスク遂行力ではClaude Opus 5に一歩譲る結果となった。価格だけで飛びつくのではなく、自社の用途に合った指標を見極めたうえでの導入判断が求められる。














