当前位置:首页 > Deepseek最新资讯 > 正文内容

DeepSeek、GPT-5都在尝试的快慢思考切换,有了更智能版本,还是多模态

14小时前Deepseek最新资讯33

  当前,业界顶尖的大模型正竞相挑战“过度思考”的难题,即无论问题简单与否,它们都采用 “always-on thinking” 的详细推理模式。无论是像 DeepSeek-V3.1 这种依赖混合推理架构提供需用户“手动”介入的快慢思考切换,还是如 GPT-5 那样通过依赖庞大而高成本的“专家路由”机制提供的自适应思考切换。它们距离真正意义上的“智能思考”仍有距离。这些方案或将判断压力转移给用户,或受限于复杂的系统架构和高昂的部署成本。因此,研发一款轻量化、支持多模态且能实现更智能自适应思考的大模型,将为用户提供更加流畅的交互体验。

  近期,由腾讯混元团队与中科院自动化所合作的一项最新研究推出 R-4B 多模态大模型,通过自适应思考(auto-thinking)机制,改变了这一现状,它让 AI 能像人类一样 “智能切换” 思维模式。简单问题直接响应,复杂问题深度推理,在最大化回答准确性的同时,最小化计算开销。

  这一 “按需思考” 的核心能力,为 4B 量级的多模态模型树立了全新的性能标杆,使其在评测性能指标上成功超越了 Keye-VL-8B、Kimi-VL-A3B-Thinking-2506 等更大规模的模型。

  登顶 OpenCompass 多模态学术榜单:在 20B 以内规模多模态大模型中,性能排名 Top 1!

  目前,该模型已在 GitHub 和 HuggingFace 上线,且支持 vLLM 快速部署。「消费级显卡即可运行,适用于笔记本电脑、智能座舱、智能家居等低功耗场景,支持垂直领域低成本微调。」截至目前下载量已破万,欢迎大家体验!

  R-4B 的核心创新在于其独特的两阶段训练策略。为实现模型在通用领域的自适应思考,研究团队首先提出双模退火(bi-mode annealing)训练策略,促使模型同时掌握通用领域的思考与非思考能力。

  该阶段可以理解为对模型进行 “思考” 启蒙,即同时喂给它两种范式数据:一种需要直接回答(非思考模式,像日常对话),另一种需要详细推理(思考模式,像解数学题)。通过这种训练,模型同时掌握了思考和非思考这两种响应模式,为后续的自适应思考模式训练打下坚实基础。该阶段的核心是通用领域推理和非推理模式的数据构建策略:针对客观题,用模型采样的答案一致性来衡量题目的难易程度;针对主观题目,用提示工程的方式去区分解决问题是否需要进一步思考。

  经过退火训练,得到一个同时精通思考与非思考模式的基础模型 R-4B-Base ,为后续自适应思考强化训练奠定基础。基于此,团队开发了双模策略优化(Bi-mode Policy Optimization, BPO)强化学习算法。它无需依赖精心设计的奖励函数或特定数据,而是仅依赖基于规则的奖励信号,从数学数据出发,并可泛化到通用领域。其核心是混合双模 rollout 机制,通过强制模型在训练中同时探索思考模式和非思考模式轨迹,从而避免模型陷入对单一模式的响应偏好deepseek。在此基础上,通过同时奖励两种思考模式的策略,使模型自己学会判别何时应该思考。

  更关键的是,R-4B-RL 在自适应思考模式下实现了推理效率的提升,在简单任务下模型无需消耗更多的 Token。这证明了 BPO 算法的有效性,即无需通用领域的强化学习数据或额外的奖励函数设计,模型也能实现自适应思考。

  应用智能:在日常问答分析中,自动切换简单查询(如文档内容提取)和复杂推理(如图表分析)的思维模式,提升自动化处理效率。

  科学研究:在处理科学图表时,R-4B 的深度推理模式可解析多步关系,精准解读数据,提高研究效率。

  消费级 AI:边缘设备部署中,R-4B 凭借更少的参数和自适应思考模式降低延迟和能耗,适用于即时问答系统。

  从双模退火训练到 BPO 优化,R-4B 不仅解决了 MLLMs 的思考困境,更在小尺寸模型上探索了自适应思考的可行性 。自适应思考不仅是技术优化,更是对效率与普惠平衡的追求。在 AI 计算与推理成本飙升的今天,R-4B 的轻量化、智能化设计,为大模型可持续发展注入绿色动力。原文出处:DeepSeek、GPT-5都在尝试的快慢思考切换,有了更智能版本,还是多模态,感谢原作者,侵权必删!

标签: deepseek

“DeepSeek、GPT-5都在尝试的快慢思考切换,有了更智能版本,还是多模态” 的相关文章

齐鲁软件园联合山东大学、浪潮集团打造开源社区

齐鲁软件园联合山东大学、浪潮集团打造开源社区

  今年以来,DeepSeek在全球掀起一股生成式AI大发展潮流,各行各业纷纷拥抱开源DeepSeek。业内认为,DeepSeek最大的贡献和价值在于通过开源,推动了AI的普惠。2024年...

讲个鬼故事:霍伊伦加盟曼联就进过1粒头球,而塞斯科同期进了8粒!

讲个鬼故事:霍伊伦加盟曼联就进过1粒头球,而塞斯科同期进了8粒!

  除了几个很抽象的单刀 我觉得抢点还可以 射门有时候超神有时候抽象 他有练好头球的条件 但是意愿强不强不知道   除了几个很抽象的单刀 我觉得抢点还可以 射门有时候超神...

“太好办”AI政务通,深度赋能重构政务服务新图景

“太好办”AI政务通,深度赋能重构政务服务新图景

  为进一步加快政务服务数字化转型,持续优化营商环境,近日,太仆寺旗政务服务与数据管理局积极探索DeepSeek与政务服务深度融合,创新推出“太好办”AI政务通应用,提供政务服务高频事项智...

「DeepSeek们」回答位变广告位

「DeepSeek们」回答位变广告位

  AI正在重塑现代职场与当代生活。如果说在过去,人们遇到问题往往会首 选“搜一下”,如今,则变为“问问AI”。或许是ChatGPT和DeepSeek,也可能是豆包和元宝……...

【国元研究】通信行业周报——DeepseekV3.1发布,卫星发射持续推进

【国元研究】通信行业周报——DeepseekV3.1发布,卫星发射持续推进

  本周(2025.8.18-2025.8.24)上证综指上涨3.49%,深证成指上涨4.57%,创业板指上涨5.85%。本周申万通信上涨10.84%。考虑通信行业的高景气度延续,AI、5...

仅靠5000+样本,全新强化学习范式让30B轻松击败671B的DeepSeek

仅靠5000+样本,全新强化学习范式让30B轻松击败671B的DeepSeek

  传统强化学习(RL)在有标准答案的指令遵循任务(如数学、代码)上已趋成熟,但在开放式的创意写作领域却因缺乏客观对错而举步维艰。如何让 RL 突破「可验证奖励」的边界?蚂蚁技术研究院联合...