稀疏,是有代价意识的选择
注意力不是"算得越多越好"。DSA 的关键在于细粒度地选择需要计算的 token, 从而把长文本训练与推理的开销压下去,同时保持效果不掉线。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp。在 V3.1-Terminus 的基础上, 引入 DeepSeek Sparse Attention(DSA),让长文本的训练与推理效率被重新拉高; 随之而来的,是 API 价格整体下调超过 50%。
效率的提升从不来自堆叠,而来自选择。DSA 做的,是让模型只计算真正需要计算的部分。
DeepSeek Sparse Attention(DSA)首次实现了细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下, 实现了长文本训练和推理效率的大幅提升。为了严谨地评估引入稀疏注意力带来的影响, 团队把 DeepSeek-V3.2-Exp 的训练设置与 V3.1-Terminus 进行了严格的对齐。
在各领域的公开评测集上,DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 基本持平。 这意味着:效率的提升,不是靠牺牲能力换来的。
建议社区在进行研究性实验时,使用基于 TileLang 的版本,以方便调试和快速迭代。
成本下降带来的最大受益者是开发者。所有官方平台与标准 API 接口,已默认使用 V3.2-Exp。
| 项目 | V3.1-Terminus | V3.2-Exp | 变化 |
|---|---|---|---|
| API 整体价格 | 原标准 | 下调 50%+ | ↓ |
| 默认模型 | V3.1-Terminus | V3.2-Exp | 已切换 |
| V3.1-Terminus 访问 | 标准通道 | 限时保留 · 同价 | 至 2025-10-15 |
| 官方平台 | 旧版 | App / Web / 小程序已升级 | 已同步 |
V3.1-Terminus 的临时访问地址:
base_url="https://api.deepseek.com/v3.1_terminus_expires_on_20251015"
如果你只记住一句话,就记住这两件。
注意力不是"算得越多越好"。DSA 的关键在于细粒度地选择需要计算的 token, 从而把长文本训练与推理的开销压下去,同时保持效果不掉线。
先用 TileLang 做快速原型,再用底层语言实现更高效的版本——这是本次算子开源的两条腿。 研究场景建议用 TileLang 版本,方便调试和快速迭代。
无论你是个人用户还是开发者,都可以在这一版里直接开始。
App、网页端与小程序已同步升级为 V3.2-Exp,无需额外操作。
标准 API 接口默认使用 V3.2-Exp,价格即刻生效新标准,无需申请。
把 base_url 换到 v3.1_terminus_expires_on_20251015,即可继续对比 V3.1-Terminus。
"让效率提升,和让能力提升,本来就不该是两件事。"
关于 V3.2-Exp 的最常被问到的几个问题。
DeepSeek-V3.2-Exp 是 DeepSeek 推出的实验性版本,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA),大幅提升长文本训练与推理效率。
DSA 首次实现细粒度稀疏注意力机制,在几乎不影响输出效果的前提下,显著提升长文本的训练和推理效率。
DeepSeek 宣布 API 定价即刻生效新标准,整体降幅超过 50%。
官方限时保留 V3.1-Terminus 的 API 访问通道至 2025 年 10 月 15 日,调用价格与 V3.2-Exp 相同。只需把 base_url 换成 https://api.deepseek.com/v3.1_terminus_expires_on_20251015 即可。