行业资讯

DeepSeek轻量旗舰上线千问AI平台

Heooo 09月14日17时34分 48 阅读

「DeepSeek-V4.1-Flash近日上线千问AI平台,API与Token Plan同步开放。该模型为552B总参数的MoE轻量旗舰,输入激活约8B、输出激活约16B,支持文本与图像理解,最长上下文100万token,平台最大输出约393K,并给出闲时与忙时分时计价。」

DeepSeek 新一代轻量旗舰模型 DeepSeek-V4.1-Flash 近日正式上线千问 AI 平台,API 服务与 Token Plan 同步开放。开发者既可以通过标准 API 把模型接入自有业务系统,也能在 Qoder、千问 APP、Codex 等工具中直接调用 Token Plan,用于代码生成、文档处理、视觉理解与智能体任务,接入路径相对统一。

从架构上看,该模型采用总参数 552B 的 MoE 架构,并使用 Causal-Encoder-Decoder 非对称结构,输入侧激活参数约 8B、输出侧激活参数约 16B。它原生支持文本与图像理解,最长上下文达 100 万 token,平台侧最大输出约 393K。官方表示,该模型在多项 Agent 与代码基准上较同系前代有明显提升,思路是以更低的激活参数换取更高的吞吐与更低的延迟,从而在长上下文与高频调用场景中保持稳定表现。

成本优化是本次上架的重点。新一代缓存压缩技术使 KV Cache 对 HBM 的需求降至上一代的四分之一,对 SSD 存储的需求降至八分之一,长上下文推理与多轮工具调用因此更加节省资源。千问页面给出了分时价格:闲时每百万 token 输入 1 元、输出 4 元;忙时每百万 token 输入 2 元、输出 8 元。速率限制方面为 RPM 15K 与 TPM 1M,功能覆盖前缀补全、函数调用、上下文缓存、结构化输出、批量任务与联网搜索。

部署层面,阿里云百炼联合 vLLM 开源社区完成了适配,中国站与国际站均可调用,地域覆盖北京、新加坡以及 Global 的美国、德国、日本、香港等节点。百炼文档显示,该模型支持多轮对话、函数调用、联网搜索、上下文缓存与结构化输出,max_tokens 上限约 393216,适合企业把长文档解析、客服知识库、代码仓库问答和多模态审单等工作迁移到同一接口,减少多模型拼装带来的工程成本。

业内认为,V4.1-Flash 把大参数、小激活、强缓存这套组合放进千问生态,会明显降低长上下文 Agent 的试错成本。对中小团队来说,闲时低价叠加 Token Plan 订阅,可以在批量推理与原型验证之间更灵活地分配预算,也更容易把实验性想法快速推向可用产品。

# DeepSeek # 千问AI平台 # MoE架构 # 长上下文 # API开放

来源:Heooo AI工具导航