DeepSeek-R1 “小更新”：靠后训练改进就能榨出如此多潜力开云体育- 开云体育官方网站- APP 最新2025

2025-06-03 19:29:20　　点击量：

　　开云体育官方,开云体育app,开云app下载,开云棋牌,开云直播,开云体育靠谱吗,开云体育和亚博,开云体育老板是谁,开云官网,开云体育,开云直播英超,开云电竞,开云游戏,开云,开云体育官网,开云体育官方网站, 开云app, kaiyun sports, 开云体育简介, 开云体育官方平台, 世界杯开云, 开云体育app下载, 开云体育网址, 开云体育2025

DeepSeek-R1 “小更新”：靠后训练改进就能榨出如此多潜力开云体育- 开云体育官方网站- 开云体育APP 最新2025

　　一个显著的例子是在 AIME 2025（美国数学邀请赛）测试中，新版模型的准确率从旧版的 70% 大幅提升至 87.5%。官方将这一进步归因于模型在推理过程中思维深度的增强。数据显示，在 AIME 2025 测试集上，旧版模型平均每题使用 12K tokens，而新版模型则平均使用 23K tokens，表明其在解题时进行了更为详尽和深入的思考。这种“更长的思考时间”换取更高准确性的策略，也成为社区讨论的一个特点。

　　深度求索认为，DeepSeek-R1-0528 的思维链对于学术界推理模型的研究和工业界针对小模型的开发都将具有重要意义。在R1最初发布时，这就是DeepSeek想要证明的技术趋势之一，而这个叫做DeepSeek-R1-0528-Qwen3-8B的小模型，是最新的证明。该模型最核心的技术亮点在于成功地将 DeepSeek-R1-0528 这种超大规模模型的复杂“思维链”（Chain of Thought, CoT）蒸馏到一个仅有8B参数量的 Qwen3-8B 基座模型上。结果显示，蒸馏后的8B模型在极具挑战性的AIME数学竞赛中取得了超越原版Qwen3-8B达10%的成绩，甚至达到了与235B参数量的Qwen3-235B相当的水平。这强有力地证明了高质量思维链对于提升小模型推理能力的巨大潜力，以及蒸馏技术在传递这种高级认知能力方面的有效性。这一成果会继续打破“唯参数论”的迷思，它展示了通过先进的训练方法（如思维链蒸馏），小参数模型完全有可能在特定复杂任务上达到或接近远超其参数规模的大模型的性能水平。这对于算力受限、追求更高效率和更低部署成本的场景具有极其重要的现实意义。

　　例如，在著名代码测试平台 LiveCodeBench 的早期测试中，新版 R1 展现出与 OpenAI 最新 o3 高版本模型相媲美的表现。Analytics Vidhya 等分析机构也认为，R1-0528 作为开源模型，在数学（如AIME测试中接近OpenAI o3水平）、通用推理（GPQA Diamond）和编码能力上，已经成为 Gemini 2.5 Pro 的有力挑战者，并在性价比方面展现出显著优势，其性能表现接近 Claude 级别，而成本则低数倍。

　　幻觉改善：针对大模型常见的“幻觉”问题，新版 R1 进行了优化。在改写润色、总结摘要、阅读理解等场景中，幻觉率降低了约45%至50%，能提供更准确可靠的输出。此前DeepSeek系列模型最为人诟病的问题就是幻觉，此前在Vectara HHEM人工智能幻觉测试——行业权威测试，通过检测语言模型生成内容是否与原始证据一致，从而评估模型的幻觉率，帮助优化和选择模型——中，DeepSeek-R1显示出14.3%的幻觉率，这不仅是 DeepSeek-V3的近4倍，也远超行业平均水平。此次根据官方的数据，幻觉问题得到了很大的改善。这对于这款模型继续进入更深的生产场景至关重要。