9月10日,DeepSeek在HuggingFace上以MIT协议开源了V4.1Flash,同时附上完整技术报告。总参数552B的多模态混合专家模型,上下文窗口100万token——这些是常规操作。真正改写成本账本的是一个不起眼的数字:全局KV缓存每token只要890字节,是上一代V4Flash的四分之一,相比初代V1压缩了437倍。KV缓存为什么值钱?长上下文Agent会话里,模型必须把读过的
A5创业网 版权所有