DeepSeek V4 Flash正式版刚出就在九项Agent测试里全部超过V4 Pro Preview了,提升最大的一项DeepSWE,在已有开源项目做长周期功能开发那一项提升了7.5倍得分,离了个大谱。
而且从放出来的对比图可以超前看到DeepSeek应该马上会放出来自己的Agent框架,DeepSeek Harness,还会分不同模式,这次跑分就用了极简模式。
还有还有,这次他们做了一下codex优化适配,在API文档里面也做了一下V4 PRO正式版的小预告,说是在8号初会支持接入codex。
我把文档看完之久来光速总结一下,DeepSeek做了一个一键设置的脚本,能够直接配置到codex的cli和桌面端。这个脚本会向codex声明DeepSeek模型的原数据,包括上下文窗口长度,支持的推理档位以及工具的使用模式等,那就可以让codex像内置模型一样使用DeepSeek模型。然后还会保留原有所有的MCP以及项目信任等级。
如果要体验正式版的话要切换到API,目前App和Web端还没更动。我整理了一下,现在我大规模用API的场景基本都是走DeepSeek的,
1. 用沉浸式翻译接API做长视频双语字幕翻译
2. 长文档读取,现在用DeepSeek读论文基本没出现过失忆的情况了
3. 批量管理电脑文件,接入codex之后做1T苹果电脑的全盘扫描可以持续30分钟扫出来100G的多余文件
4. 浏览器自动化表现很离谱,因为我ai news radar这个AI热点Skill在API失效的时候会降级到浏览器自动化,所以我尝试用它来抓了50个博主最近一周的更新,基本没掉。
5. 因为用1M上下文,用DeekSeep API可以一次性加载整个中大型的代码库,所以我会用来给codex做长期目标前的素材准备。
6. 长时间代码项目维护,通过Hermes定制读取我Github开源Skills出现的issue和pr。
一句话总结,需要高频的任务都塞给DeepSeek V4 flash就好了。完全可以让Fable5出计划让DeepSeek去做,它已经完全有这个实力了。
DeepSeek V4 Flash 0731的模型结构和尺寸完全没变,只重新做了后训练,价格也没变,还是那么能打,还是比GPT,Claude那些低了一了一个量级,还是用起来一点都不心疼,
所以还是那句话,
永远可以相信DeepSeek!
相信他们想让人人都用得起Agent的决心!