当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布新版本模型:优化推理效率,API降价超50%

2周前 (09-30)Deepseek最新资讯91

  值得注意的是,此前有不少科技博主发现,DeepSeek-V3.2新模型已上传至其HuggingFace官方页面,随后被删除,此后DeepSeek正式公告新版本的推出。

  据DeepSeek介绍,作为迈向新一代架构的中间步骤,V3.2-Exp在V3.1-Terminus的基础上引入DeepSeek Sparse Attention(一种稀疏注意力机制),针对长文本的训练和推理效率进行探索性优化和验证。目前,官方App、网页端、小程序均已同步更新为DeepSeek-V3.2-Exp,同时API大幅度降价。

  据了解,DeepSeek Sparse Attention(DSA)首次实现细粒度稀疏注意力机制,在几乎不影响模型输出效果的前提下,实现长文本训练和推理效率的大幅提升。为严谨评估引入稀疏注意力带来的影响,把DeepSeek-V3.2-Exp的训练设置与V3.1-Terminus进行严格的对齐。在各领域的公开评测集上,DeepSeek-V3.2-Exp的表现与V3.1-Terminus基本持平。

  在新模型的研究过程中,需要设计和实现很多新的GPU算子,使用高级语言TileLang进行快速原型开发,以支持更深入的探索。在最后阶段,以TileLang作为精度基线,逐步使用底层语言实现更高效的版本。此次开源的主要算子包含TileLang与 CUDA两种版本。

  DeepSeek表示,得益于新模型服务成本的大幅降低,官方API价格也相应下调,开发者调用DeepSeek API的成本将降低50%以上。从价格来看,输入缓存命中从0.5元降至0.2元/百万tokens,缓存未命中从4元降至2元/百万tokens,输出由12元降至3元/百万tokens。

  除了DeepSeek,国内另一大模型厂商智谱的新一代旗舰模型GLM-4.6也即将发布,目前deepseek,在Z.ai官网可以看到,GLM-4.5标识为上一代旗舰模型。

  此前9月18日,梁文锋带着DeepSeek-R1的研究,登上最新一期国际顶级期刊《自然》(Nature)封面。

  《自然》杂志指出,如此总结DeepSeek-R1带来的进步:如果训练出的大模型能够规划解决问题所需的步骤,那么它们往往能够更好地解决问题。这种“推理”与人类处理更复杂问题的方式类似,但这对人工智能有极大挑战,需要人工干预来添加标签和注释。

  DeepSeek的研究人员揭示了他们如何能够在极少的人工输入下训练一个模型,并使其进行推理。DeepSeek-R1模型采用强化学习进行训练。在这种学习中,模型正确解答数学问题时会获得高分奖励,答错则会受到惩罚。原文出处:DeepSeek发布新版本模型:优化推理效率,API降价超50%,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek发布新版本模型:优化推理效率,API降价超50%” 的相关文章

AI基础设施领域唯一标杆, 北电数智“数智化算力底座”入选2025服贸会十一项北

AI基础设施领域唯一标杆, 北电数智“数智化算力底座”入选2025服贸会十一项北

  以“数智领航,服贸焕新”为主题,2025中国国际服务贸易交易会(服贸会)于9月10日-14日在北京举办。本届服贸会吸引了近2000家企业“赴约”参展,85个国家及国际组织通过设展办会深...

张骏吐槽DeepSeek过度思考致回答延迟

张骏吐槽DeepSeek过度思考致回答延迟

  #DeepSeek是很内耗的人工智能# 张骏又开启神吐槽模式!半决赛这轮他说在每次问Deepseek一些问题它都要自己盘问一番,比如你问它1+1等于几,它会先说:用户现在问我1+1等于...

南京片仔癀博物馆祝贺DeepSeek赋能财务知识培训会成功召开

南京片仔癀博物馆祝贺DeepSeek赋能财务知识培训会成功召开

  近日,常州航天信息分公司在常瑞宾馆举办DeepSeek赋能财务:解锁财务工作自动化线下课,来自常州各地区企业财务总监,财务经理,税务会计,会计人员110余人参加此次培训,带大家探索智能...

Deepseek推荐全国旅游百强区第49名:安徽合肥市包河区

Deepseek推荐全国旅游百强区第49名:安徽合肥市包河区

  日前,全国县镇发展研究课题组、天和经济研究所县镇发展研究院联合发布了2024《全国县镇发展报告》,报告评价篇对全国县市以及包含乡村人口的市辖区旅游发展水平进行了综合评价,并发布了天和2...

AI技术助力英语教育创新 泰格新一代英语发布结构思维研究成果

AI技术助力英语教育创新 泰格新一代英语发布结构思维研究成果

  长期以来,传统英语教育普遍存在学习过程单调、学生压力大、家庭投入高等“难、贵、累”问题。9月12日,泰格新一代英语在深圳举行首发仪式,基于多项国家发明专利及18年行业积累,借鉴汉语“偏...

大豪科技(603025.SH):DeepSeek AI 智算一体机、电信高阶智算

大豪科技(603025.SH):DeepSeek AI 智算一体机、电信高阶智算

  公司主业聚焦智能装备电控系统及相关产品、智能工厂云平台系统,以及网络安全与网络通信硬件的定制开发及平台集成服务。公司旗下兴汉网际已布局相关业务,DeepSeek AI 智算一体机、电信...