2026 年 9 月 10 日,国内领先的智能体平台 AiPy 正式发布《AiPy 适配度评测报告 · DeepSeek-V4.1-Flash(0910)》。这是全网首份针对 DeepSeek-V4.1-Flash 的适配度测评报告。报告显示,该模型在 63 项真实办公与开发任务中成功交付 59 项,综合成功率达 93.7%,不仅反超前代旗舰 V4-Pro,其峰值输出速度更达到 V4-Pro 的 7 倍以上,标志着国产大模型在“智能体适配”这一关键赛道上实现代际跃升。
一、从“对话”到“交付”:AiPy 重新定义智能体评测标尺
在全球人工智能产业加速从“模型竞赛”迈向“应用落地”的当下,如何衡量一个大模型是否真正“可用”,正成为行业关注的焦点。作为国内智能体领域的先行者,AiPy 长期深耕“模型—工具—交付”全链路适配评测,其发布的适配度报告以“真实客户端、真实任务、真实交付物”为方法论,已成为观察国产大模型工程化能力的重要窗口。
与业界常见的“刷榜式”基准测试不同,AiPy 的适配度评测聚焦一个朴素而严苛的问题:模型能否在真实客户端环境中,理解用户意图、正确调用本地工具与联网能力,并最终产出可交付的实体文件。本次评测基于 AiPy Pro 2.0.1 客户端,以 DeepSeek-V4.1-Flash(0910)为执行内核,跑通 63 项覆盖多模态理解、文档与数据处理、联网检索与调研、系统与桌面操控、代码与工具开发、内容创作与设计六大能力维度的端到端任务,每一道题都要求产出 HTML、Word、PPT、PDF、图片、音视频或可执行程序等真实交付物,而非简单的问答对话。
二、93.7% 反超 V4-Pro:轻量与旗舰的界限被重新定义
报告最引人注目的结论,是新一代 Flash 系列在成功率上完成了对上一代 Pro 旗舰的反超。数据显示,DeepSeek-V4.1-Flash(0910)在 63 项任务中成功交付 59 项,综合成功率达 93.7%,属于“高可用”水平;相较之下,前代旗舰 V4-Pro 的成功率为 88.4%,前代 V4-Flash 为 82.6%。这意味着,新一代 Flash 较 V4-Pro 提升 5.3 个百分点,较 V4-Flash 提升 11.1 个百分点,在成功率这一关键指标上实现了对“能力优先”路线旗舰的超越。
速度层面的优势同样显著。实测中,V4.1-Flash(0910)最高输出速度可达 500+ tokens/s,大部分回复稳定在高速区间,交互体验接近“秒回”。作为对比,前代 V4-Flash 此前测试最高约 218 tokens/s,V4-Pro 则不到 70 tokens/s——V4.1-Flash(0910)的峰值速度约为 V4-Flash 的 2.3 倍、V4-Pro 的 7 倍以上。

三、四大维度满分:结构化交付链路高度稳定
从细分能力维度看,V4.1-Flash(0910)在多项核心能力上实现 100% 通过:多模态理解(1/1)、文档与数据处理(13/13)、代码与工具开发(9/9)、内容创作与设计(10/10)均获满分;联网检索与调研达到 90.5%(19/21)。报告指出,满分维度的共同特点是“输入明确、产出可校验”,模型能够稳定地读取文件、编写代码、生成 HTML、Word、PPT、PDF 等交付物并完成本地落盘,在“结构化数据—可交付文件”这条主链路上表现出极高的稳定性。
评测同时揭示了待突破的环节:系统与桌面操控维度成功率为 77.8%(7/9),4 项失败任务中有 3 项属于“系统级集成”问题——模型理解意图无误,但工具调用链路、应用适配层或结果校验环节存在断点。报告认为,这属于工程适配问题而非模型能力短板,可通过补齐应用适配层、增加渲染后自检等工程手段缓解。
四、全新架构加持:普惠成本下的“前沿智能”
公开资料显示,DeepSeek-V4.1-Flash(0910)是深度求索于 2026 年 9 月 8 日开启限时内测的中间版本大模型,采用全新模型结构,在架构层面原生支持多模态输入,最长支持 100 万 tokens 上下文,且计费标准与 DeepSeek-V4-Flash 持平。这一“能力升级、价格不涨”的定位,使其在智能体场景中兼具速度与成本优势。

从 V4 Flash 到 V4 Pro 再到 V4.1 Flash(0910),DeepSeek 系列在 AiPy 上的适配度呈阶梯式上升:V4 Pro 以 88.4% 证明了“能力优先”路线的高度,V4 Flash 以 138 秒的平均耗时守住“效率优先”的底线,而 V4.1 Flash(0910)则在两者基础上进一步把成功率推至 93.7%——既保留了 Flash 系列的响应速度优势,又在复杂任务稳定性上向 Pro 看齐甚至反超。这一趋势被业界视为国产大模型正加速进入“前沿智能、普惠成本”新阶段的信号。
随着智能体从“能聊天”走向“能干活”,以真实交付为标尺的适配度评测,正在成为衡量大模型工程化价值的关键维度。AiPy 方面表示,将持续推进模型适配评测工作,为用户提供更优质的智能体服务体验。
A5创业网 版权所有