DeepSeek又发重磅更新 后训练提升模型能力-鼎巢网

DeepSeek又发重磅更新 后训练提升模型能力

   2026-08-03 01:47:55 新浪鼎巢网11
核心提示:后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测

后训练正成为大模型能力提升的新变量。DeepSeek 最近更新了 DeepSeek-V4-Flash,官方称之为“正式版”,但目前仅在 API 端上线公测。此次更新只涉及 deepseek-v4-flash,V4-Pro API 以及 App 和网页端当前使用的模型并未随之更新。

值得注意的是,DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只是重新进行了后训练。这引发了人们的疑问:没有换架构,为什么能力还能提升?

大模型的训练可以简单分为两个阶段。首先是预训练,模型通过大量文本和代码学习知识,形成基础能力。其次是后训练,这是针对具体工作的专项训练,让模型学会如何回答问题、调用工具以及按要求完成任务。这次 DeepSeek 没有重新设计模型架构或扩大参数规模,而是在原有模型上重新进行后训练,导致内部权重和行为方式发生变化。

这种变化类似于同一辆车未更换发动机,却重新调整了变速箱、控制系统和驾驶策略。车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布具体的后训练数据、奖励方法和训练流程,因此无法进一步断言性能提升究竟来自哪一种技术。

新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试不同于传统代码补全,它们要求模型进入一个工作环境,读取文件、理解代码仓库、调用终端、修改程序、运行测试,并根据报错继续处理。这意味着模型不仅要知道答案,还要连续完成多个步骤。

 
免责声明:以上所展示的信息由网友自行发布,内容的真实性、准确性和合法性由发布者负责。 鼎巢网对此不承担任何保证责任, 鼎巢网仅提供信息存储空间服务。任何单位或个人如对以上内容有权利主张(包括但不限于侵犯著作权、商业信誉等),请与我们联系并出示相关证据,我们将按国家相关法规即时移除。

本文地址:http://www.dingchaow.cn/news/97642.html

 
更多>同类资讯
推荐图文
推荐资讯
点击排行

免责声明:本站所有信息均来自互联网搜集,产品相关信息的真实性准确性均由发布单位及个人负责,请大家仔细辨认!并不代表本站观点,鼎巢网对此不承担任何相关法律责任!如有信息侵犯了您的权益,请告知,本站将立刻删除。
友情提示:买产品需谨慎
网站处理与建议:wfmyw@qq.com