即刻App年轻人的同好社区
下载
App内打开
stormzhang
85关注3k被关注4夸夸
同名公众号 stormzhang,技术&产品人,AI Builder。
stormzhang
12天前
爬上来说个事,Jev 刷屏快一周了,全网都在吹「新技术路线」。

后台也有不少人问我怎么看?我说句扫兴的:别吹了。

先说下它是啥。前 OpenAI 研究员创业做的模型,最大的特点是不说话,不生成文字,它只帮你做决策。

你给它一段状态加几个问题,它直接返回带概率的判断:选哪个,打几分,有多少把握。

它为什么爆?我说实话,不是因为它强,是它戳中了两个当下 AI 的痛点:token 贵,AI 慢。

拿大模型做分类路由,等于拿大炮打蚊子,烧几百 token 就为了拿回三个 JSON 字段。Jev 输入每百万 token 0.042 美元,输出免费,毫秒级返回。

所以它确实在一些细分场景有用。

比如客服工单一次调用分出部门,紧急度,流失风险,不用等大模型慢悠悠给你写小作文。

比如给大模型当护栏,做模型选择和内容审核。啥活适合什么样的便宜模型,很多人是没有这方面的判断能力的。

比如批量处理文档,实测每千份成本 0.22 美元,DeepSeek Flash 要 1.31 美元。

但别吹成技术突破。能力上和 DeepSeek Flash 打平。

「不会幻觉」是重新定义出来的,OpenAI 的结构化输出,Anthropic 的 tool use 等早就做到了。护城河 48 小时就塌了,推特老哥两小时拿 Qwen 搓出同款,400M 的开源 laya 基本是同款。

能被两小时复现的东西,是工程技巧,不是模型突破。

你要想体验,直接去 GitHub 下载本地部署这个项目:

github.com

所以你要问我怎么看?

Jev 本质上就是一个 JSON 分类器套了层前沿模型的皮。

但是它算是盒合格的止痛药,治的是贵和慢这两个真病。在一些场景上是有需求,但是吹嘘远大于它的能力,X 上一大堆开发者是把它当玩具的。

但是你要拿它当主力出活,做工程,做产品,还是洗洗睡吧。
11
stormzhang
21天前
昨晚全网都在讨论一个事,可以说炸锅了。

爬上来给大家说下什么事。

1.起因是 Anthropic,以下简称「A➗」,它发了一份报告,指责中国各种 AI 公司又开始蒸馏它了。这份报告可以说非常详细,基本上大家听过的国内顶尖 AI 公司都在列。

2.其实蒸馏这个事,在 AI 领域早就是公开的秘密了,大家早就见怪不怪了,而且不只是国内这么干,国外顶尖 AI 公司也这么干的。我就说一件事,你们有没有注意到,最近几个月 A➗ 和 OpenAI 的模型对中文的理解非常精准,甚至蹦出来的中文口头禅比我们自己用的都溜。

3.要知道国产模型最大的优势就是中文语料非常丰富,你说它们没有蒸馏我们的国产模型语料,就能在这么短的时间内,让中文处理和回复这么人性化,根本没人信。

4.但是 A➗ 这次特意指责 Kimi,说部分 API 请求直接路由到 Claude 模型,还监测到一些敏感企业的敏感数据。我看了下这份报告,完全是单方面指控,没任何实质证据。

5.但是我来给大家解释这意味着什么,且不说这个真的假的,如果是真的,就意味着所有 Kimi 用户花着国产模型的钱,用的却是贵几倍的 Claude 模型,还有这种好事?就好比你花了二锅头的钱,给你掺飞天茅台,嗯,这样的掺假多来点最好。

6.至于所谓的泄露敏感企业数据的指责,要知道 Kimi 是开源的,国内一些特殊企业如果涉及敏感数据,完全可以本地部署,数据不出本地,真当我们一些敏感企业是吃素的?真有敏感数据,一家顶尖 AI 公司完全有能力对数据进行分析清理,但是 Kimi 没这么做,是不是可以变相说明 Kimi 真的对用户数据保护得比较好,不侵犯用户隐私?

7.A➗ 这份报告对 Kimi 的指责是重头。自从 Kimi K3 发布,就对闭源模型构成了极大的威胁,这是国产模型里第一个敢和全球顶尖模型掰手腕的,让 A➗ 再也无法掌握定价权。加上 GPT-6 发布,A➗ 直接被打趴了,现在在上市前扔出这份所谓的分析报告,这不是急了是什么?

8.A➗ 这份报告,其实变相说明它们对用户数据分析得相当详细,一边说着保护用户隐私,数据不外泄,一边又不打自招。但凡对数据敏感的,我都建议务必不要用 A➗ 家的产品了。

9.A➗ 最近也在学 Codex,给用户重置了额度。之前你还有领先优势,现在国产模型崛起,加上 OpenAI 的冲击,所谓的领先优势都没了,现在开始把用户当人了,早干嘛去了?我之前就说过,这家公司早晚自己作死。

10.骂归骂,但是不得不承认,Claude 系列的产品确实还不错,但是我们要看相对进步。你们仔细想想,除了 Opus 4.6,之后的 4.7、4.8 和 Opus 5,是不是一代比一代拉?相反,全球其他 AI 公司的模型不都是一代比一代有巨大提升?说白了,它就是有了先发优势而已。我甚至有时候会想,4.6 是不是一个偶然间搞出来的东西,他们内部甚至自己都不知道为何能达到领先地位。

11.现在如果你还觉得 Claude 的产品全球领先,那就真 out 了。

但凡你用下 GPT-6 Astra + GPT-Image-2.5,就会发现这个组合在前端能力和编程能力上,可以说全面吊打一直以这些能力为傲的 A➗。很多人对国产 AI 和 OpenAI 的印象还停留在几个月前,我只能说你的思维完全被限制了。

12.以前我们边骂边用 A➗ 家的模型,那是没办法,没得选,想用最强的只能选它。现如今,我们自己早就抛弃了 Claude,它一没任何领先优势,二不把用户当人,三之前泄露的水印代码,百分百确认这家公司就是针对中国用户,现在只剩下义正词严地骂了。

13.说回 A➗ 对 Kimi 的指责,甚至泼脏水,把矛头引到我们敏感企业身上,激发我们自己的内部矛盾,让我们自己处理内部问题,可以说算盘打的真好,对我们国内的情况摸的非常清楚。

A➗ 一边打不过 GPT-6,另一边只能拿国产模型开刀,它越针对 Kimi,就说明它越怕。Kimi K3 这个开源模型,相当于重新定义了全球闭源模型的定价权,这对 A➗ 的利益伤害是最大的,这简直是给 Kimi 打了最大的广告。

信我的,想用全球最强的 AI,有条件的就优先选择 Codex,想用国产的,就上 Kimi,对数据敏感的,那就本地部署,A➗ 让它接着作好了。
20
stormzhang
1月前
说个扎心的事实。

当下市面上充斥着一大堆垃圾产品。

AI 时代,做工具,做插件,做产品的门槛太低了,哪怕一些新手,借助 AI 都可以折腾出一些产品出来。

绝大部分人,幻想着做个网站,做个 app 火起来,然后躺赚,这都是天方夜谭。

现实是,很多人钱没少花,token 没少消耗,一顿操作猛如虎,开发了 10 个产品,最后一看用户 5 个。

真别不信,这就是当下很残酷的现实。

再说个数据,deepseek harness 发布之后,短短的时间,GitHub topic 已经有 8000 多个插件发布。

这其中有多少是真正有价值的?绝大部分也都是垃圾插件。

甚至如果你分辨不清,你装个乱七八糟的插件,很可能就是你电脑的常驻病毒。

产品也好,插件也罢,你是否有在重复造轮子?是否真正有市场需求?你做的产品是否真的算是生产级产品?

绝大部分人都不具备市场生产级产品的能力,只是借助 AI 瞎折腾而已。

而现实也确实,现如今市面上单纯靠 AI 赚钱的个人和公司非常少,基本都处于花钱花 token 的阶段。

但是未来,整个市场对 AI 的人才需求,市场需求是很大的,现阶段,最该做的,是提升自己 AI 的底层能力,这个作为第一要务,比你天天花时间开发出一堆无用的垃圾产品有用的多得多。

别再问我,现如今我做出什么 AI 产品了。

我做的 AI 产品还真的不少,但是都是服务我自己,服务内部团队提效用的。

除了一些开源项目,目前为止面向 C 端用户的正式产品没有一个。

不是我做不了,而是我觉得如果做了,大概率就是花了时间,花了成本,最后一场空。

我现在在做的 AI 产品和工具,一是提效,整个团队工作的效率先提升个 10 倍再说,其实现在已经不止了。二是提升 IP 影响力,这是长期复利价值。三是服务现有星球用户,提升所有球友的 AI 底层能力。

目前来看,每一项都成果显著。

听我一句劝,别瞎折腾乱七八糟的没有市场刚需的产品了,也别重复造轮子,更别幻想靠着做出一个产品一夜暴富。

先提升自己的 AI 底层能力,想办法提升自己的工作效率和生产力,如果有内容创作能力的,去尝试下自媒体,短视频,积累流量和影响力,做有复利的事,这在未来会非常非常有价值。
61
stormzhang
1月前
DeepSeek 刚刚上线了多模态模型 v4-flash-vision-exp。

在当下多模态已经成为大模型标配的时代,DeepSeek 终于补齐这个短板了。

现在它可以直接接收图片,识别截图、文字和图表,同时保留 V4 Flash 的推理、编程与 Agent 能力。

官方称,其纯文本能力与 V4 Flash 基本相当,涉及视觉理解的 Agent 能力已经接近 Claude Opus 4.8。

不过,值得单独提的是,图片输入的价格。

根据官方文档,每张图片最多只计算 384 输入 tokens。按高峰期、缓存未命中的价格计算,一张图片最高约 $0.00017,累计处理 1000 张图片也 只需要约 $0.17,不包含文本和输出成本。

这意味着,低成本视觉 Agent 真正具备了实用价值。

它可以查看网页截图、分析报错界面、检查前端设计、读取图表,再根据看到的结果继续调用工具。

而且这里有个小技巧,有些人如果需要大量的输入,比如处理论文,解读书籍之类的。如果直接输入给大模型,那 token 输入会很大。

这里提供个思路,你可以预先把大量文字排版处理成图片,让模型以较少的视觉 token 完成资料预读。

这种方式叫“光学上下文压缩”,DeepSeek 自己的 OCR 模型此前就研究过类似方向。

如果一张只计算 384 个视觉 tokens 的图片,可以放入约 3000 个原始文本 tokens,理论压缩率就接近 8 倍,极大的节省输入 token。

当然,图片不是无损压缩包。文字放得越密,模型越容易遗漏数字、标点和细节。

所以,也不能无限把一大堆密密麻麻的文字压缩到一张图片里,这会导致模型识别内容难度很大,增加出错概率。

这个思路,对一些特定论文研究,大量输入并且要节省 token 的同学有帮助。

我之前就说过,当下的 AI 时代,早就不是单一领域模型能力的竞争了,是多模态,Agent 以及 AI 生态多维度的竞争。

最近 DeepSeek 从发布自己的 harness,以及 web agent,再到补齐多模态能力,基本都是往生态走的。

所以按照这个方向,我一直反复强调,推荐大家当下订阅各家的 AI 套餐,都建议以月为单位,未来是模型能力 + Agent + 多模态的天下,AI 发展速度如此之快,你订了年套餐,很可能下个月就被替代了,这条切记。
01
stormzhang
2月前
爬上来说几点关于 DeepSeek 的事。

1. DeepSeek 今天全面涨价,还实行峰谷定价:高峰期北京时间 09:00-12:00、14:00-18:00,费用是低谷期的两倍。AI 时代奖励夜猫子,这句话被 DeepSeek 进一步具象化了。

2. 虽然涨价,但之前太便宜了,白菜价,涨完依然全球最便宜。只不过 DS 按量计费,从订阅套餐角度看,尤其 Codex 最近一个多月老是重置,性价比最高的还是 Codex 订阅。

3. DS 上周发布了自己的 harness 框架,一切皆插件,理念确实前沿,给开发者更多定制空间。本意就是争取开发者,借开源社区壮大 harness 生态。

4. 但依我看,这可能是不得已的路线。Agent = Model + harness,不再是只拼模型的时代。Claude Code、Codex 都迭代多少版本了,DS 想短时间超越很难,才选了这条路。

5. 一切皆插件看似前沿,也会带来问题:AI 时代谁都能开发插件,生态质量参差不齐,用户筛选成本很大,别有用心的人还会带来安全隐私问题。

6. 我们期待的是旗舰级 Agent 产品,现在交付的是本地 web 服务--开发难度和适配性最简单的那种。桌面版和 TUI 才是复杂度更高、需要长期投入的。TUI 在发布前被删,说明 DS 有团队在做,但做得不够好,还需要时间。

7. DS 背负的压力可以想象。我的建议是干脆把 TUI 发出来,承认不完善,后续迭代就好。

综合判断:DS 的 harness 现在是开发者玩家的玩物,普通用户不着急用。Codex、Kimi Code 依然是大部分人开箱即用的最优选择,再给 DS 一些时间。
00
stormzhang
2月前
# 第三方 Agent 和官方 Agent,到底该选谁?

爬上来,说下不少读者关心的这个问题。

现在有很多第三方 Agent,如 OpenCode,Hermes,Pi 等,相比较于原生的 Codex,Claude Code,Kimi Code 等,到底怎么选更好呢?

我的推荐是,尽量用原生 Agent。

一个很现实的问题,既然模型都是人家的,为什么不直接使用 AI 公司自己的 Agent?

要理解这个逻辑,先得分清 Model、harness 和 Agent。

如果把 AI 比作赛车,Model 是发动机,提供基础能力;harness 则是赛车的座舱和操控系统--方向盘、变速箱、仪表盘,Agent 是赛车手 + 整车,负责理解目标、观察环境并决定下一步行动。

简单来说,大模型负责思考,Agent 负责行动,harness 负责让行动稳定发生。

第三方 Agent 和官方 Agent 最大的区别,不是谁更会写 Prompt,而是谁能控制整个系统。

第三方可以设计自己的交互、界面、工具、上下文和工作流,却很难修改底层模型。

AI 公司则既能造赛车,也能修改发动机。它们可以根据 Agent 的实际表现继续训练模型,让模型更擅长调用工具、理解上下文和完成长任务。

这是一种结构性优势。

第三方今天通过复杂 Prompt 和工作流解决的问题,明天可能被一次模型升级直接解决。很多所谓的 Agent 工程,本质上都是在弥补当前模型的不足。

因此,在编程、搜索、研究、写作等通用任务上,我更推荐优先使用 AI 公司自己的 Agent。

它们通常能更快获得最新模型能力,模型、Agent 和 harness 也能一起迭代。

当然,第三方通用 Agent 也有一个真实优势:

可以自由切换各家模型,不被单一厂商锁定,以及有时候为了吸引用户,可能有一些便宜的套餐之类的。这可能也是当前很多人选择第三方 Agent 的最主要原因。

另外,如果你是 harness 开发者,多研究第三方开源 Agent 没坏处。上下文怎么管,工具怎么接,任务怎么拆,各家的做法都摆在明面上,正好吸收各家所长。

所以,我的建议很简单,如果你已经用 OpenAI,Anthropic,Kimi 等前沿模型,我更推荐结合 Codex,Claude Code,Kimi Code 原生 Agent 配合使用,效果通常更佳。

不过,也有不少模型能力有很大进步,但是 Agent 还没来及去做,比如 DeepSeek,前段时间刚发布的 DeepSeek-V4-Flash 公开评价能力提升很大,这让大家更期待 Pro 的发布。

目前官方推荐和 Codex 结合使用,但是 DeepSeek 自己的 harness 团队在着手研发自己的 Agent,并且已经在公开招募内测。

给它点时间,后续用 DeepSeek 自家的 Agent 结合自家的 DeepSeek-V4-Pro 模型,也许会更能打。

未来不会缺少强模型,也不会缺少 Agent。

真正拉开差距的,是模型和 Agent 一起迭代的能力。
00
stormzhang
2月前
爬上来给大家一个建议:交个程序员朋友吧。

千万别信市面上所谓的 AI 时代,第一批淘汰的就是程序员。

我的观点很直接,那些到现在还没有大力拥抱和全面使用 AI 的程序员,以后会淘汰,但是具备 AI 能力的程序员,在以后会越来越吃香。

AI 现在写代码确实很强,但是从「一段能跑的代码」到「一个能用的东西」,中间隔着需求,部署,调试,安全,还有一堆你根本不知道存在的坑。这些坑,AI 不会主动告诉你,但是程序员朋友踩过。

我自己就有深刻体会。

现在创业圈好多朋友,都是我从做自媒体开始认识我的,根本不知道我以前是写程序的,自从知道我做过技术后,遇到问题,基本都开始问我了,我推荐的工具,给他们的解决方案,他们很相信。

之前也遇到过其他朋友,问怎么搞定账号和环境问题,让 AI 反复改个 bug 搞不清楚,气的直骂娘。后来我就直接推给他一个程序员圈友,基本是立刻就解决。

十年前,交一个程序员朋友,最大的用处是帮你修电脑,装系统,抢火车票。
现在不一样了。

AI 时代,程序员朋友是普通人手里最便宜的外挂。

但前提是,这个程序员朋友是全力拥抱 AI 并且具备 AI 能力的。

AI 时代,程序员的上限被拉得比以前高得多。以前他能帮你写个小脚本,现在他能帮你攒一个小产品出来。同样是朋友,含金量今非昔比。

所以我的建议很直接:

去交一个程序员朋友,真心的那种。

不用多,一个就够。请他吃个饭,聊聊你在用 AI 干什么,踩了什么坑。他给的信息增量,比你刷一周信息流都多。

AI 时代,人人都说自己有 AI 这个朋友。

但真正值钱的,是那个懂 AI 的活人。
01
stormzhang
2月前
最近 AI 圈都在关注编程模型和 Agent,打得火热,但上周 AI 视频圈也很热闹。

先说背景,Sora 已关停。3 月宣布停服,4 月关站,API 撑到 9 月 24 日。曾经的行业标杆,就这么退了场。

然而这个领域国产 AI 公司竞争很激烈。

1. 7 月 31 日,MiniMax 发布 H3,8 月 3 日直接开源权重。2K 分辨率,15 秒,原生立体声,0.13 美元一秒,大概是 Seedance 2.0 的三分之一。Artificial Analysis 视频编辑榜,全球第一。这是视频赛道第一个旗舰级开源模型。

2. 8 月 1 日,字节发布 Seedance 2.5。30 秒原生 4K,能塞 50 张参考图,还能按时间戳控制第几秒发生什么。账面参数拉满。不过社区实测吐槽,人物会有不自然的停顿,对白弱。

3. 可灵最近没发新模型,但 ARR 冲到 5 亿美元,还传出要分拆独立上市,估值 200 亿美元,腾讯领投。

AI 视频之所以普通人很少关注,主要是成本太贵用不起,多是 B 端和视频自媒体团队在用。

但 Sora 退场后,AI 视频依然是很火的赛道,从能力,到画质,再到价格,进步都很迅速。

H3 更是把价格打到三分之一,权重直接挂出来,ComfyUI 当天就支持,开发者当天就能在本地跑。这和当年网约车大战一个逻辑,补贴抢的不是乘客,是司机。

AI 编程抢的,是开发者生态,AI 视频赛道抢的,是创作者生态。

字节背靠抖音和 TikTok 两大短视频内容平台,这块有天然最大的优势,现在基本是全球 AI 视频领域的王者。

Google 有 Youtube,按理来说也有很大潜力,可惜不管是在 AI 编程还是在视频,都不知道在干什么。

xAI 背靠 X,Imagine 1.5 也更新了,加上图片参考和声音参考,原生 1080p。但被吐槽还不行。

在我看来,AI 未来的竞争,绝不是单一领域,一定是生态。AI 视频一定是 AI 生态不可或缺的一环。

我有个大胆的预测,也许用不了多久,高质量的视频生成与制作,很快就是即时的,一旦成本大幅打下来,以后的视频自媒体,电影制作,3A 游戏画面都会全面是 AI 的天下。

也许未来的某一天,OpenAI 有可能重启 AI 视频业务也说不定。
00
stormzhang
3月前
Kimi K3 订阅套餐果然抢不到了!

我昨天的文章说的其实挺隐晦,但是我在星球说的原话是:

「你们信我的,之后可能会抢不到。」

这下你们应该信了吧。

原因很简单,这个真不是饥饿营销,而是国产算力紧缺是最大限制。

Kimi K3 我体验之后,我就知道,K3 是真的当下国产最强,配合 Kimi Code cli,这就是当下最强的工程能力最强的 AI Agent 整套工具。

一开始很多人会觉得吹,但是一旦体验过会自己感知到,然后买单的。

很多人因为种种原因用不了 CC 或者 Codex,或者嫌贵,那么 Kimi Code cli + K3 就是当下国产最好的平替,没有之一。

真正用它做过项目的,自然会感受到它是真的强还是夸大。

很多球友信我的,在昨天最后阶段抢到了订阅套餐。

抢不到的也没关系,信我,尽力去用上 Codex,最近 Codex 反复重置额度,如果你用的很多,算下来可能比国产还便宜。

最关键的是,Codex + GPT-5.6,在工程能力上,是当下最强,甚至超越 Fable5,我自己深度对比过的,信不信由你们。

唯一的劣势是慢一些,但是没所谓,AI 时代,大家要习惯多线程,同时干几个项目,定好计划和目标,让 AI 去跑就完事了,一个窗口慢,但是你同时干五六个项目,其实这点影响不是很大。

额外再补充一点,如果你习惯刷 X,去冲个 X 会员,可以直接用 Grok 4.5,白嫖额度,而且速度极快,马斯克最大的优势就是不差钱,算力管够。

未来 Grok 4.5 能力上再提升下,潜力会非常大。
00
stormzhang
3月前
爬上来说三点很多人不知道的事:

1. 很多人老是问我,说你老评测国外大模型,但很多人因为种种原因,一直用不了,就问我说,能不能评测下国产大模型?

我说实话,因为我自己一直用全球前沿大模型做项目、做产品,所以对国外大模型是自己真实做项目的实践,才能给出真实结论。

但是对国内大模型的发展也一直关注。

你要非问我国内大模型,哪些目前是比较强的,从我最近关注的 X 上的开发者的反馈,给你们简单说下。

最近 Anthropic 和 OpenAI 竞争的比较凶,有开发者大 V 专门点名感谢 OpenAI、Meta、xAI、GLM、Kimi 持续给 Claude 施压。

这里看出来,GLM、Kimi 被单独点名,足以说明一些问题。

2. 而从我关注了解到的 X 上开发者们的评价,也确实都认为 GLM、Kimi 在工程能力上,在国产大模型领域目前是比较抗打的。

这里解释下什么是工程能力?

类比工程能力是 1+1 = 2 的事,你给出的结果哪怕是 2.00001,那都不行,工程方面属于对就是对,错就是错。所以 AI 编程能力基本就代表了工程能力。你一段代码逻辑错了,会导致整个系统运行不下去。

但是如果你要是日常写作,处理下周报,生个图片,做个调研,最后给你处理 70 分还是 80 分,其实对整个系统都没多大影响。

所以工程能力也是目前全球 AI 公司在主力做的事,AI 做工程如果都很强,那其他事情对它来说基本是小孩桌的需求。

所以,GLM、Kimi 目前在国产模型领域,X 上的一众开发者,普遍认为还可以,虽然和 Opus、GPT-5.6 这类还有差距,但是已经看到差距在不断缩小。

3. Fable 5 现在已经延期到了 7/19 号,有人预测这是为 Opus 5 做准备,确实,Fable 5 和 Sonnet 5 都已经发布,Opus 5 肯定也不远了。

而且下半年,我们可能会见证一个全球大模型发布的高发点,比如:GPT 6,Fable 5.5,Gemini 3.5 Pro,Grok 5,Spark 2,Kimi 3,Minimax M3.5,GLM 6,DeepSeek v4.5,Mistral 4,Qwen 4,MiMo 3 等等等。

AI 大模型的能力会越来越强,各家的能力也会不断追赶对齐。

模型能力越来越强,「人」可能会是一个最大短板,不同的人对 AI 的使用以及技术、产品、商业理解会导致差距越来越大,如果你现在还没用 AI,即便之后 AI 能力很强,你依然不知道该用 AI 做什么。

以上,给大家分享,仅作参考。
00