news 2026/9/13 23:46:56

DeepSeek V4.1 Flash发布:轻量模型反超旗舰,API升级与计费要点

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek V4.1 Flash发布:轻量模型反超旗舰,API升级与计费要点

9月10日,DeepSeek发布了V4.1 Flash。有点反常识的是:这是它新架构系列里尺寸最小的一款,官方却说在基准测试里超过了包括V4 Pro在内的旗舰模型。据报道,9月11日腾讯旗下WorkBuddy、CodeBuddy已全量接入,OpenCode同步接入。对普通开发者来说,最实际的是三件事:模型名怎么换、价格怎么算、老模型什么时候下线。

这次到底变了什么

架构上,V4.1 Flash是552B参数的MoE(混合专家)模型,但用了一套新的Causal-Encoder-Decoder结构,特点是输入和输出不对称——输入只激活8B参数,输出激活16B。翻成大白话:读进去的部分便宜,写出来的部分才贵,而模型总盘子还是很大。这和过去"参数越大越强、成本越高"的线性印象不太一样。

成本上最狠的是缓存。官方称新一代把KV Cache压得很小,对HBM(高带宽显存)的需求降到上一代的1/4,对SSD的需求降到1/8;相比初代模型,KV Cache一共缩小了437倍。这个数字对做Agent、做长上下文应用的人最有意义,因为这类场景里缓存命中的费用往往占大头。

还有个信号:Flash这次是"反超"Pro的。官方已明确将有序下线V4 Pro。过去Flash一直是廉价快速版,如今轻量型号开始接替旗舰,这在国产大模型里并不常见。

对开发者意味着什么

没变的是:OpenAI兼容的调用方式没变,base_url没变,多模态还是"输入图片、输出文字"这个路子。变的是模型名和计费。

模型名方面,新版调用名改为deepseek-flash。旧的deepseek-v4-flashdeepseek-v4-flash-vision-exp已经下线,出于兼容会被临时路由到V4.1 Flash。据官方说明,北京时间9月14日12:00之后,deepseek-v4-pro的请求也会全部路由到V4.1 Flash,并按V4.1 Flash单价计费。也就是说,代码里写死了老模型名,短期不会报错,但效果和价格在悄悄变。

计费是峰值、闲时两档。闲时缓存命中输入0.02元/百万token,缓存未命中输入1元/百万token,输出4元/百万token;高峰时段(工作日9:00–12:00、14:00–18:00)按2倍计。据报道,缓存命中价相比上一代下降约六成。

代码最简单,基本就是改一个字符串:

fromopenaiimportOpenAI client=OpenAI(api_key="sk-你的key",# 在 platform.deepseek.com 申请base_url="https://api.deepseek.com",)resp=client.chat.completions.create(model="deepseek-flash",# V4.1 Flash 的新模型名messages=[{"role":"user","content":"用 Python 写一个快速排序,带注释"}],)print(resp.choices[0].message.content)``` 标准openai库即可,不用换SDK。## 怎么选、怎么省、有哪些坑1.**批量任务挪到闲时。**输出单价闲时是高峰的一半,数据清洗、离线摘要、批量代码生成这种不急的活丢到晚上跑,账单能省一半;在线客服、实时补全这类场景就别为了省钱去等。2.**固定前缀,让缓存命中。**命中0.02元 vs 未命中1元,差50倍。做法是把系统提示、固定的知识片段放在消息最前面,且不随轮次改,后面再拼用户输入。前缀一变,缓存就废了。3.**别迷信"反超旗舰"的宣传口径。**官方基准和你的业务常有差距。上生产前用真实样本跑一遍,重点看格式遵循率、长上下文里指令有没有丢、以及你这类图片上的理解准确率。有测评称速度有数倍提升,但那些数字来自内测第三方,正式版要自己测。4.**留个回滚开关。**模型名、价格、能力这一周内都调整过,把模型名做成配置项,出问题能一键切回,别硬编码。 想自己部署的话,模型已在Hugging Face开源;官方称大规模部署需要2k卡GPU和存储集群,这门槛一般团队够不上,走API更现实。 这一代的关键词,其实是"便宜""够快"一起到位,而不是单纯堆参数。你最近有没有把线上模型换掉?换来换去省下的钱,够不够覆盖重调一遍prompt的时间,评论区聊聊。
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/13 23:37:57

嵌入式AI编程:重构STM32开发流程的五层耦合方法

1. 这不是“用AI写代码”,而是重构嵌入式开发的认知框架 你搜“AI编程 STM32”,刷出来的大多是“让ChatGPT帮你生成GPIO初始化代码”这类短视频标题。但真正跑通一个带AI能力的STM32项目,比如用本地模型做实时语音关键词唤醒、用轻量级Transf…

作者头像 李华
网站建设 2026/9/13 23:37:55

小白也能看懂:AI大模型何时调用RAG?5大场景+收藏必备指南

本文详细解析了AI大模型在何种场景下会使用RAG技术,包括知识时效性断层、私有数据需求、高事实性要求、长尾查询和动态更新需求。通过“全能助理”的生动比喻,将复杂概念转化为通俗易懂的实例,帮助读者快速理解RAG的作用和限制,是…

作者头像 李华
网站建设 2026/9/13 23:37:53

GD32H759 + RT-Thread 工控实战--第1篇 CAN总线

前言 本篇开始调试GD32H7的CAN,目标为跑通回环、自发收、以及与上位机通讯。需要额外2条杜邦线、一块candlelight USB-CAN模块。本篇为边开发边记载,所以阅读顺序可能不那么愉快。 一、驱动代码编写与kconfig修改 1.1 为何要自己编写can驱动 首先rt-t…

作者头像 李华