DeepSeek最新发布的V4.1 Flash,在面向真实应用场景的设计评测中展现出接近OpenAI GPT-6 Astra的成绩,但生成成本明显更低。
据Decrypt等媒体9月10日报道,OpenDesign Arena最新评测结果显示,DeepSeek V4.1 Flash获得81.2分(满分100分),仅比GPT-6 Astra低1.5分。此次评测共纳入13款AI模型,除GPT-6 Astra外,其余模型得分均低于V4.1 Flash。
相比评分差距,成本差异更为明显。数据显示,GPT-6 Astra完成单个设计任务的成本为1.61美元,而DeepSeek V4.1 Flash仅为0.023美元,约为前者的1.4%。在速度方面,GPT-6 Astra平均耗时11.1分钟,V4.1 Flash则为5.3分钟。
此次评测由OpenDesign发起,在同一设计题目下对13款AI模型进行横向比较,参测模型包括Anthropic Claude Fable 5.1、Grok 4.6、Qwen 3.8-Max等。结果显示,V4.1 Flash不仅得分位居前列,在成本和完成效率上也占据明显优势。
OpenDesign Arena的评分体系主要围绕日常设计工作场景,覆盖Web应用、仪表盘、移动端界面和落地页制作等任务。其中,30分考察需求满足度,70分用于评估布局与信息层级、配色以及风格适配等维度。该测试更侧重模型在真实设计任务中的稳定交付能力,而非通用推理或编程表现。
在主要竞品中,Claude Fable 5.1得分为80.3分,平均耗时12.8分钟,单个成品成本为3.66美元。与之相比,V4.1 Flash在分数接近的情况下,速度更快、成本也更低。
DeepSeek将这种成本效率归因于新架构设计。技术文档显示,V4.1 Flash采用混合专家(MoE)架构,总参数规模为5520亿;在输入阶段激活80亿参数,在输出生成阶段激活160亿参数。DeepSeek将其描述为“因果编码器—解码器”结构,通过在输入与输出阶段采用不同激活参数规模来提升性价比。
不过,这项评测也存在明确的适用边界。OpenDesign要求,只有能够渲染为可运行网页的结果才会被纳入评分;若出现空白页面、页面损坏或输出中途截断,则直接记为0分,且不进行重测。因此,该基准更适合衡量模型是否能够稳定生成可信的日常设计成品,而不能简单外推至通用推理或编程能力。
OpenAI于9月3日发布的GPT-6 Astra,主要覆盖计算机操作、软件工程、网络安全、科研及专业工作等场景。此次在设计评测中,GPT-6 Astra拿下最高分,但在成本和速度两项指标上落后于DeepSeek V4.1 Flash。
在“生成后可直接交付、无需额外修改”的成品比例上,两者差距并不大:V4.1 Flash为57.7%,GPT-6 Astra为60%,Claude Fable 5.1为56.7%。
近期,DeepSeek持续以低成本策略缩小与竞品之间的性能差距。市场也有观点认为,在另一项基准测试中,V4 Pro与Claude Fable 5的差距已缩小至约5%,同时定价更低。不过,这一比较基于多项基准结果汇总,最终结论仍会受到评测方法影响。
此外,DeepSeek今年5月还在北京招聘用于开发Code Harness的产品经理和研发工程师。外界据此认为,该公司正从模型能力本身进一步向代码代理及面向开发者的运行环境延伸。
DeepSeek在官方推文中表示,DeepSeek-V4.1-Flash是其新架构家族中体量最小的模型,具备原生视觉理解能力,定位于更强能力、更快推理和更高吞吐,并可进一步扩展至更大规模模型。