摘要:9月10日,DeepSeek V4.1 Flash模型正式发布,给出的答案却有些不同:不仅更强、更快,重点还在于更普惠。
9月以来,大模型行业迎来一轮密集的发布潮。OpenAI推出GPT-6 Astra,谷歌发布Gemini 3.8 Flash,Anthropic上线Claude Fable 5.1和Mythos 5.1,Meta祭出Muse Spark 1.3。国内厂商同样没有缺席,阿里千问、智谱、腾讯混元在更早的两周内接连更新。Benchmark排行榜上,最强模型的“保质期”已经短到以周计算,“周抛”从调侃变成了行业对新常态的描述。

在这种节奏里,几乎每一家厂商都在回答同一个问题:如何让模型更强、跑分更高。9月10日,DeepSeek V4.1 Flash模型正式发布,给出的答案却有些不同:不仅更强、更快,重点还在于更普惠。
V4.1 Flash是DeepSeek全新模型结构系列中尺寸最小的模型,具备原生多模态视觉理解能力。新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。
它可以直接识别和理解图片内容,不再依赖外部视觉模块来“转译”图像信息。一张表格截图、一份产品说明书、一段手写笔记,模型都能直接处理。对日常使用AI工具的人来说,这也拓宽了实际可用的场景边界。

不过,真正值得注意的,是DeepSeek实现这一能力的方式。DeepSeek V4.1 Flash是一个552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称,输入激活只有8B,输出激活16B,成本显著低于已知的同尺寸模型。简单来说就是:面对一个问题,模型不需要调动全部“脑力”来理解输入,只在需要生成回答时才投入更多计算资源。这种不对称设计,让它在保持大参数规模智能水平的同时,单次推理的算力消耗显著降低。
得益于架构创新,DeepSeek下调了V4.1 Flash的价格,同时保留了峰谷定价机制:闲时价格为高峰时段的一半。具体而言,闲时输入缓存命中单价0.02元、未命中1元、输出4元;高峰时段对应翻倍。高峰时段限定为工作日9:00至12:00、14:00至18:00,周末和夜间全部按闲时计费。

DeepSeek V4.1 Flash的发布,提供了一个值得思考的对照:在一个所有人都加速奔跑的赛道上,DeepSeek选择把精力放在让旗舰级能力变得更便宜、更可及。当模型能力的绝对差距逐渐缩小,真正决定用户留存的,可能不是榜单上的名次,而是同样的任务量下,谁的成本结构更合理。
这并不意味着DeepSeek放弃了性能竞争。恰恰相反,V4.1 Flash在Agent和编程任务上的表现说明,效率本身就可以是一种性能。在一个“周抛”成为常态的市场里,用户最终会流向那些让他们用得起、用得久的模型。