当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek发布最新技术论文,梁文锋是共创之一

3周前 (02-18)Deepseek最新资讯57

2月18日,DeepSeek官方在海外社交平台X上发布了一篇纯技术论文报告,论文主要内容是关于NSA(Natively Sparse Attention,原生稀疏注意力),官方介绍这是一种用于超快速长文本训练与推理的、硬件对齐且可原生训练的稀疏注意力机制。

具体来说,NSA针对现代硬件进行了优化设计,能够加速推理过程,同时降低预训练成本,且不牺牲性能。它在通用基准测试、长文本任务和基于指令的推理中均能达到或超越全注意力模型的表现。稀疏注意力为提高效率同时保持模型能力提供了一个有前景的方向。

记者注意到,在这篇名为《原生稀疏注意力:硬件对齐且可原生训练的稀疏注意力机制》(Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention)的论文署名中,DeepSeek创始人梁文锋也作为共创在列。

在论文中,DeepSeek团队表示,业界越来越认识到长上下文建模对于下一代大型语言模型的重要性,推动这一需求的应用包括深度推理、仓库级代码生成和多轮自主代理系统。然而,随着序列长度的增加,标准注意力机制的高复杂度成为了关键的延迟瓶颈。

论文提到,理论估计表明,在使用softmax架构(一种用于多分类问题的神经网络架构)时,注意力计算占解码64k长度上下文总延迟的70%-80%,这凸显了对更高效注意力机制的迫切需求。

记者将这一论文提供给DeepSeek,并让其评价对业界的影响与意义,DeepSeek称,这一技术的核心价值在于平衡效率与性能,既降低计算成本,又保持甚至提升模型能力。对行业而言,NSA为处理长上下文任务提供了一种高效的解决方案,有助于推动更强大、更经济的语言模型的发展,尤其是在需要处理长文本的应用场景中。

NSA通过高效的长序列处理能力,使模型能够直接处理整本书籍、代码仓库或多轮对话(如千轮客服场景),扩展了大语言模型在文档分析、代码生成、复杂推理等领域的应用边界。例如,Gemini 1.5 Pro已展示长上下文潜力,NSA可进一步降低此类模型的训练与推理成本。

此外,DeepSeek提到,NSA能够降低算力门槛与部署成本。端到端稀疏训练可以减少预训练所需的计算资源(如减少A100 GPU小时数),降低企业开发大模型的资金与技术门槛。同时,可以加速推理,使长文本生成(如代码补全、故事续写)的实时性更高,适用于边缘设备或低延迟场景。

一位X用户在DeepSeek帖子下表示,“NSA 机制改变了游戏规则。超快速长上下文训练对于扩大教育领域 AI 至关重要,这与个性化学习愿景完美契合。”还有网友对此调侃“RIP Nvidia”。

自1月20日发布DeepSeek-R1并搅动AI圈以来,DeepSeek方面一直较为低调,这是这么多天以来DeepSeek唯一发布的技术动态。

“DeepSeek team is cooking! ”(DeepSeek 团队正在积极工作!)有X网友表示。

(本文来自第一财经)


“DeepSeek发布最新技术论文,梁文锋是共创之一” 的相关文章

财务人如何用DeepSeek摆脱加班?这6招让你躺赢!DeepSeek能自动做账、出报表、写分析,财务人员会被干掉吗?

财务人如何用DeepSeek摆脱加班?这6招让你躺赢!DeepSeek能自动做账、出报表、写分析,财务人员会被干掉吗?

DeepSeek能自动做账、出报表、写分析,财务人员会被干掉吗?每次新技术浪潮涌来,总有人说财务会被取代。但工具再先进,还是要看在什么人手里。DeepSeek不会让财务这个职业消失,但一定会加剧两极分...

青海移动完成基于国产化算力的DeepSeek模型部署

青海移动完成基于国产化算力的DeepSeek模型部署

中国移动通信集团青海有限公司基于寒武纪MLU 590国产化算力资源池,已全面部署上线DeepSeek国产化大模型服务,实现了全版本覆盖、全尺寸适配、全功能畅用,全方位加入DeepSeek生态圈。【新华...

DeepSeek崛起:人工智能如何重塑品牌营销的未来

DeepSeek崛起:人工智能如何重塑品牌营销的未来

随着数字化、智能化时代的深入发展,品牌营销不再仅仅依赖传统的广告投放或简单的营促销手段。如今,品牌必须采用更加精细化、个性化和互动化的策略,才能满足消费者日益多元化、快速变化的需求。与此同时,人工智能...

薛少华:DeepSeek改变了我们什么?

薛少华:DeepSeek改变了我们什么?

提要:当前技术环境的剧烈变革给人类适应数字智能时代不断施加认知压力,特别是“银发群体”可能成为“数字难民”的主要成员,会对当下流行和即将到来的智慧家居、具身机器人和动态数智环境交互产生极大的不适应感,...

海南机场接入DeepSeek,助力智慧机场建设,将推动智能化应用场景全面落地

海南机场接入DeepSeek,助力智慧机场建设,将推动智能化应用场景全面落地

2月23日,海南机场接入DeepSeek人工智能大模型,在智慧民航领域的创新探索迈出了重要一步。此次部署基于私有化架构,结合企业级向量知识库技术,将核心业务数据存储于专属私域环境,构建起全方位、多层次...

腾讯:微信接入DeepSeek不使用用户信息和隐私,仅整合公众号等公开信息

腾讯:微信接入DeepSeek不使用用户信息和隐私,仅整合公众号等公开信息

微信回应灰度测试接入DeepSeek。2月16日,澎湃新闻记者获悉,微信搜一搜在调用混元大模型丰富AI搜索的同时,近日正式灰度测试接入DeepSeek。被灰度到的用户,可在对话框顶部搜索入口,看到“A...