---
title: "DeepSeekの新モデルはなぜ出力コストを40分の1まで下げられたのか。「V4.1 Flash」の新設計と実力を確かめる"
description: "中国DeepSeekが発表した新モデル「V4.1 Flash」。新設計「Causal Encoder-Decoder」の仕組みと、大手モデルを上回った・下回ったベンチマーク、価格の実態を確認した"
url: https://itpostjp.com/ai/deepseek-v4-1-flash-causal-encoder-decoder-release/
category: "AI・生成AI"
published_at: 2026-09-14T22:30:00Z
updated_at: 2026-09-16T22:12:00Z
author: "IT Post編集部"
editor: "編集長 千田智也"
publisher: "IT Post by Rice Studio Lab"
language: ja-JP
ai_generated: true
ai_model: claude-sonnet-5
terms: ["MoE（専門家混合）", "オープンウェイト", "マルチモーダルAI"]
---

# DeepSeekの新モデルはなぜ出力コストを40分の1まで下げられたのか。「V4.1 Flash」の新設計と実力を確かめる

IT Post編集部 ＆ 編集長 千田智也

中国DeepSeekが発表した新モデル「V4.1 Flash」。新設計「Causal Encoder-Decoder」の仕組みと、大手モデルを上回った・下回ったベンチマーク、価格の実態を確認した

## 30秒で分かる結論

- 中国のAI企業DeepSeekは2026年9月10日、新しい基盤モデル「DeepSeek-V4.1-Flash」を発表し、重みをMITライセンスでHugging Faceに公開するとともに、API経由での提供も始めました。
- 新しく採用した「Causal Encoder-Decoder(CED)」という設計により、552Bパラメータの本体に加えて196Bパラメータの補助的な記憶機構を持ちながら、実際に計算に使う量は入力処理時で80億、出力生成時で160億パラメータ分に抑えられています。
- 価格は100万トークンあたり入力0.15ドル・出力0.60ドル(オフピーク時)で、DeepSeek自身が公表した比較表では、コーディングや疑似的なサイバー攻撃演習のベンチマークで既存の大手モデルを上回る一方、別の指標では下回る項目もあります。

## まず初めに

*「本体552Bパラメータ、でも実際に使うのは80億だけです」と言われて、額面通り安心できる人がどれだけいるだろうか。*AIモデルの世界は、パラメータ数という分かりやすい指標がどんどん複雑な注釈付きになっていく一方だ。「じゃあ結局いくつなんだ」と聞きたくなる読者の気持ちを代弁しておく。※個人の感想です

![ネットワークとAIを描いた挿絵](/images/articles/deepseek-v4-1-flash-causal-encoder-decoder-release-inline-1.webp)

## 何が起きているのか

DeepSeekは2026年9月10日、新しい基盤モデル「DeepSeek-V4.1-Flash」を発表しました。モデルの重み(パラメータの具体的な数値データ)は、改変・商用利用ともに制限の少ないMITライセンスでHugging Faceに48個のファイルに分割して公開されており、DeepSeek自身のAPI(deepseek-flash)経由でも利用できます。

今回のモデルの目玉は、DeepSeekが新たに採用した「Causal Encoder-Decoder(CED)」と呼ばれるアーキテクチャ(設計方式)です。40層のTransformer(近年の大規模言語モデルの主流的な構造)を、前半20層の「エンコーダー」と後半20層の「デコーダー」に分ける構成を取っています。モデル全体は、552B(5520億)パラメータの本体(混合エキスパート(MoE)方式、複数の専門家モデルを状況に応じて使い分ける設計)に加えて、196B(1960億)パラメータ分の「Engram」と呼ばれる補助記憶機構を持ちます。ただし、Engramは必要な部分だけをまばらに読み出す仕組みのため、モデルの総パラメータ数は数え方によって748B〜769B程度まで幅があり、DeepSeek自身のHugging Face上のモデルページでは本体の552Bのみが表記されています。

処理効率の面では、入力を読み込む段階(prefill)では80億パラメータ分、回答を生成する段階(decode)では160億パラメータ分しか実際の計算には使われない設計になっており、モデル全体のサイズの割に、少ない計算量で動作します。対応する文脈の長さ(コンテキストウィンドウ)は最大100万トークンで、画像とテキストの両方を入力として扱えるマルチモーダル対応です。また、独自のメモリー圧縮技術により、1トークンあたりのメモリー使用量(KVキャッシュ)を、前モデル「DeepSeek V4 Flash」のおよそ4分の1にあたる890バイトまで削減したとしています。

価格は、100万トークンあたり入力0.15ドル・出力0.60ドル(オフピーク時)で、平日の協定世界時0時〜4時・6時〜10時に相当する時間帯は「ピーク時」として価格が2倍になります。*平日の決まった時間だけ値段が変わるAPIというのは、さながら電力プランの深夜割引だ。*同じ内容を再利用するキャッシュヒット時の入力価格は、100万トークンあたり0.003ドルとさらに低くなります。DeepSeekは当初、2026年9月14日から既存の上位モデル「deepseek-v4-pro」向けのAPI呼び出しを今回のV4.1 Flashへ自動的に切り替えると予告していましたが、利用者からの要望を受けて9月11日ごろに撤回し、V4 ProのAPIは従来の価格体系のまま提供を継続しています。

## なぜ重要なのか

今回の発表が注目されるのは、性能と価格の両面で、既存の大手AI企業のモデルと比較する具体的な数字が示されている点です。DeepSeek自身が公表した比較表によると、V4.1 Flashは、コーディング作業を模した「Terminal-Bench 2.1」で90.6点、ソフトウエア開発タスクの「DeepSWE」で74.2点を記録し、いずれもOpenAIの「GPT-5.6 Sol」やAnthropicの「Claude Opus 5」を上回ったとされています。一方で、より高度な「Terminal-Bench 3.0」「Terminal-Bench 4.0」ではClaude Opus 5に、科学知識を問う「GPQA Diamond」ではGPT-5.6 Solに、それぞれ下回る結果になっており、すべての指標で優位というわけではありません。

価格面では、複数の独立した専門メディアの報道によると、V4.1 Flashの出力価格はオフピーク時でClaude Opus 5のおよそ41分の1、GPT-5.6 Solのおよそ50分の1に抑えられているとされています。ベンチマークによって得意・不得意はあるものの、一部の作業で大手モデルに匹敵する性能を、大幅に低いコストで提供しようとする動きは、AIをサービスに組み込む開発者やビジネス利用者にとって、選択肢の広がりを意味します。

## 私たちへの影響

DeepSeekのモデルを直接使う機会が少ない一般の利用者であっても、低価格・高性能をうたうモデルの登場は、間接的な影響があります。多くのAIチャットサービスや業務アプリは、裏側で複数のAIモデルを使い分けたり切り替えたりしており、開発コストを抑えられるモデルが増えれば、利用料金の引き下げや、無料プランで使える機能の拡充につながる可能性があります。

一方で、DeepSeekは中国のAI企業であり、モデルの重みが公開されているとはいえ、API経由でDeepSeekのサーバーを直接利用する場合は、入力した内容がどのように扱われるかというプライバシー上の懸念を指摘する声も、AI業界では継続的に出ています。業務で機密性の高い情報を扱う場合は、利用するサービスがどのAIモデルを裏側で使っているか、データがどこでどう処理されるかを確認する習慣が引き続き重要です。

## 初心者が知っておくべきこと

「オープンウェイト」とは、AIモデルの学習済みパラメータ(重み)を誰でもダウンロードして使える形で公開することを指します。今回のようにMITライセンスで公開されたモデルは、企業が自社サービスに組み込んだり、研究者が独自に改良したりすることが、比較的自由に認められています。「MoE(混合エキスパート)」は、1つの巨大なモデルがすべての処理を担うのではなく、質問の内容に応じて、内部にある複数の専門家的なサブモデルのうち一部だけを呼び出して処理する設計方式で、近年の大規模言語モデルで広く採用されています。

## IT Postの見方――「元・白物家電の王国」発、値札で殴りにいくAI競争

IT Postでは、DeepSeekのようなAI企業が繰り返し打ち出す「大手に匹敵する性能を、大幅に安く」という戦略が、AI業界全体の価格競争を加速させている点を注視すべきだと考える。

*「元・白物家電の王国」だった国の企業が、今度は最先端AIの値札で世界を殴りにきている。*性能の一部で大手に及ばない項目があってもなお、「出力コストが41分の1」というインパクトのある数字を前面に出す発表の仕方は、正直うまい。IT Postでは、こうした低価格モデルの台頭が、利用者にとっての選択肢拡大という恩恵をもたらす一方、モデルの提供元がどこの国のどんな企業で、データがどう扱われるのかという確認を怠らないことが、これまで以上に利用者側に求められる時代になったと考える。※個人の感想です

## 今後どうなりそうか

DeepSeekは、今回のV4.1 Flashに続く上位モデル「V4.1 Pro」を今後リリースするとみられています。当初予告していたV4 ProからV4.1 Flashへの自動振り分けは、利用者からの要望を受けて撤回されており、V4 ProのAPIは引き続き従来の価格体系で提供されています。V4.1 Proの具体的な発表時期や仕様については、今回参照した情報源の中では明らかになっていません。IT Postでは、V4.1 Proの発表や、日本国内での利用状況に関する新たな情報があれば、あらためて取り上げます。

## 訂正履歴

- 2026-09-16T22:12:00Z: 「V4 Pro向けのAPI呼び出しがV4.1 Flashへ自動的に切り替えられ、運用に変わっています」「暫定的にV4.1 Flashへ振り分けられています」と、9月14日実施の予告どおり自動切り替えが行われたかのように書いていた記述を訂正しました。DeepSeekは利用者からの要望を受けて9月11日ごろにこの切り替えを撤回しており、V4 ProのAPIは従来の価格体系のまま提供が続いています。

## 情報源

- [deepseek-ai/DeepSeek-V4.1-Flash](https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash) — DeepSeek公式(Hugging Face)（一次情報）
- [Change Log](https://api-docs.deepseek.com/updates/) — DeepSeek公式（一次情報）
- [DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate and benchmarks eclipsing GPT-5.6 Sol, Claude Opus 5](https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5) — VentureBeat
- [DeepSeek Launches V4.1-Flash With 1M-token Context](https://dataconomy.com/2026/09/11/deepseek-v4-1-flash-ultralow-token-pricing/) — Dataconomy
- [DeepSeek V4 Pro API Call Service Will Not Be Discontinued](https://panews.io/articles/01a09045-be46-7632-8fd6-e486b08c3c21) — PANews

## この記事に出てくるIT用語

- [MoE（専門家混合）](https://itpostjp.com/terms/mixture-of-experts-moe/): AIモデルを多数の「専門家」に分割し、入力内容に応じて一部だけを働かせることで、効率よく高い性能を実現する仕組みです。
- [オープンウェイト](https://itpostjp.com/terms/open-weights/): AIモデルの学習済みデータ(重み)そのものが公開され、誰でもダウンロードして自分の環境で動かせる状態のことです。
- [マルチモーダルAI](https://itpostjp.com/terms/multimodal-ai/): 文章だけでなく、画像や音声、動画といった複数の種類の情報をあわせて理解したり生成したりできるAIのことです。

---

この記事は、公開情報と出典URLの検証、文章作成の一部に生成AIを使用しています。内容の責任はIT Post by Rice Studio Labが負います。

出典表記: IT Post by Rice Studio Lab — https://itpostjp.com/ai/deepseek-v4-1-flash-causal-encoder-decoder-release/
