即刻App年轻人的同好社区
下载
App内打开
Yangyi.
41关注6k被关注7夸夸
🔅推特:Yangyixxxx
🔅分享商业&增长营销
🔅Reverb Marketing
🔅小报童:独立开发/Reddit营销获客增长手册
置顶
Yangyi.
6月前
今天初一,牛马AI如约而至,开启第一波内测
为了限制一下内测范围,点赞转发本内容,评论“参与”
我会逐一给大家发悄悄话邀请内测群,记得查收
感谢每位愿意参与内测给反馈的朋友们🫶
----
长期邀请码:NM-7S6T-VW23
niuma.limyai.com
-----

另外,大家如果问牛马AI和其他AI客户端有什么不一样
我认为它可以说是本地免费版的manus/genspark,是AI时代的人机协同工作台

1、完全适配claude agent sdk并傻瓜安装,支持各类模型接入和本地模型,如果使用本地模型可以完全离线化
2、支持定时任务和AI长期计划,配合看板,人机协同
3、支持绝大部分类型文件的本地渲染和快速编辑处理
4、打通本地应用,比如你可以直接调用seedance生成视频,剪映素材箱立马就渲染出来了,这些素材可以无缝衔接工作流
5、支持飞书,企业微信等webhook机器人通知
6、快速协助用户傻瓜式安装skills
7、用户数据本地绝对安全,AI交互过程只转发不留存,云端没有任何用户隐私敏感数据存储
8、同步进行skills本地查杀和远端审查,进一步保证安全性(目前迭代优化中)
9、本地browser use联动(目前迭代优化中)
596258
Yangyi.
09:49
我觉得大家与其做什么FDE工程师
真不如换个思路 卖订阅服务
比如就一个企业一个月收一万块钱
可以帮助企业诊断工作流程里哪里可以使用AI改进

所有的改造都要先意识到「有提升空间」,然后再谈改造的事儿

现在大家都做反了,最值钱的部分是让企业意识到问题,而这部分做成了免费的
反而苦逼哈哈的AI落地,不断沟通摩擦的地方,去收几万块钱

一个愿意付费定义问题的人,更愿意花钱解决问题
FDE工程的起始点,是企业AI咨询

挖掘AI场景是咨询的一种
如果你足够有经验 可能还可以辅助企业文化和组织建设的咨询
构建意识是建立信任的最关键的那步
22
Yangyi.
1天前
Reddit是海外营销里最难的渠道,没有之一

它对一个营销人员的要求极高:
要能人所不能,懂内容能做出大曝光,懂GEO能留存AI推荐
还要忍人所不忍,将近60%的养号死亡率,持续死号

这两个条件,缺少任何一个,都难以长期持续做这件事儿
20
Yangyi.
1天前
把大炮给将军,将军胜仗归来,打下一座城,越打越富。
把大炮给农民,农民走火炸了房子,居无归所。

如果你平时用锄头耕田,那么你只能用上拖拉机。
如果你平时用机关枪扫射,那么你可以换上大炮。
鸟枪换不了炮,因为鸟枪只能打鸟,哪怕换了炮,他还是去打鸟,那就是高射炮轰蚊子。

这世界上有很多种降维打击,但是降维的前提是,人们从前就在高维。

这就是AI时代的真相。
00
Yangyi.
1天前
MultiAgent的Loop总结下来其实有3种判别分类,共计6种模式
针对6种不同的模式,有6种处理方案
以下逐一阐释👇🏻

一、【处理类】手上已经有一堆东西
这一类的共同前提:材料已经有了,AI 不需要创造任何东西,只需要过一遍。
共同风险:AI过完之后你以为覆盖了全部内容,但可能并没有。

解决方案有两种:
① 分类再处理 —— 异构处理
② 拆开再汇总 —— 同构处理

① 分类再处理 —— 异构处理
结构:一个分诊 agent 把全部材料读一遍打标签,然后每个标签配一个专属处理 agent。分诊只做一件事,就是决定归属;然后专属Agent挨个处理,以此降低幻觉

它解决的瓶颈是判断归属。
活儿本身不难,写四种回复模板你自己十分钟就能写完;难的是四百封信里哪封该用哪套。
这种任务的典型特征是高数量、低判断力:单看每一件都不值得你花时间,但是每次都得判断做出不同处理,也很浪费注意力

在GTM场景里常见的是:
- 入站线索分诊(真需求 / 竞品来摸底 / 求职 / 垃圾访客)
- 邮件回信分诊(感兴趣 / 合作 / 客服支持 / 退订)
- 支持工单路由
- CRM 存量数据清洗

常见的Prompt示例:

读完每一封邮件,把每封归入「感兴趣 / 合作 / 客服支持 / 退订」 四类之一,然后按类别各写对应的跟进话术。任何把握低于 80% 的,单独放进第五类 「没把握」,附上你犹豫的理由,不要硬归类进前四类里。

AI一般不会跳出你的框架,如果你不给它第五个分类,它就把不确定的硬塞进某个分类,导致出现幻觉。

所以必须显式给出"没把握"这一类,并设置置信阈值。当然,如果你有计算标准或者给定一些few shot效果会更好。

那份不确定清单是人类真正该重点关注的东西,它暴露的不是 AI 的能力上限,是AI无法理解的分类标准。

② 拆开再汇总 —— 同构处理

结构:经典的 map-reduce。N 个 agent 一人拿一项同时跑,最后一个 agent 把所有结果合成一份答案。

它解决的瓶颈是上下文窗口。

一个 agent 读四十份通话纪要,读到第二十份的时候第一份的细节已经开始模糊了;
换成四十个 agent 各读一份,每一份都是独立的。
相当于通过Token代偿来降低上下文过载的幻觉。

要不要采用这个结构,只需要关注一件事:
各项任务之间是否互相独立。 第 7 份的结论如果依赖第 3 份的产出,这个模式就不成立了。

在GTM场景里常见的是:
- 批量通话纪要提异议
- 多个目标账户各自做调研
- 全站页面对照定位声明做一致性审计
- 四十篇历史内容提取钩子模式
- 多份流程文档找互相冲突的地方。

这是六种里用得最多的一种。

常见的Prompt示例:

读这个文件夹里全部 40 份通话纪要,一份纪要一个 agent,提取客户提出的每一条 异议。然后合并成一份按出现频次排序的清单,每一条异议后面必须挂上它来自哪次通话。 只出现过一次但你认为重要的,单独列一节,不要因为频次低就丢掉。

合并环节是整条流水线上唯一的单点,也是最爱偷工减料的地方。
它有三个惯性幻觉:
- 丢掉低频但重要的信息
- 把相似的强行合并成一条
- 丢掉了出处

所以三个对策一起上:
- 强制每条结论标记来源
- 要求单列低频项
- 先出全量再排序,而不是边读边筛选

二、【生成类】要造出还不存在的东西
这一类的共同前提:产出物是新的,没有标准答案可以对照。

共同风险:AI 会自信地交出看起来完美的东西。两个分支的区别在于你首先要什么,是优先要结果正确,还是优先要结果优秀。

解决方案也有两种:
③ 先做再拆 —— 求正确
④ 多产择优 —— 求品味

③ 先做再拆台 —— 求正确
结构:串联对抗。
A agent 产出,B agent 拿着原始材料逐条校对。
B 必须看得到源材料,且不能看到 A 的推理过程,只看A给的结论。

采用这个模式就一个判断:你会不看原始材料就直接用这个输出吗? 如果不会,那就必须上这个模式做初步筛查。后面加上人工回路。

在GTM场景里常见的是:
- 客户提案里的每个数字
- 竞品对比表的每条声明
- 带 ROI 测算的报告
- 对外发布的品牌内容

凡是带数字和带"他们家不支持 X"这类断言的,都需要人工核查,那么就先走一遍AI核查吧

同样的,输出必须是三态:通过 / 不通过(附源材料里出错的那一行)/ 无法核实

常见的Pormpt示例:

把这份报告里的每一条事实性主张单独抽出来,然后由另一个 agent 拿源文档 逐条核对。给我三份清单:核实通过的、核实失败的(附源文档里对应的那一行)、无法核实的。 无法核实的标记 unverified 单独返回,不要算作错误,也不要放行。

这是最多人跳过的一种,也是唯一能治"AI 自信编造"的一种。
跳过的原因是它看起来像多此一举,而"写完之后自己复查一遍"这句话,你得到的永远是"已复查,无误"。
执行者不能是裁判员。

进阶用法是派三个视角不同的攻击者:一个查事实、一个查逻辑跳跃、一个假装是客户当场提问。

④ 多产再择优 —— 求品味
结构:一个 agent 大量生成,一个独立的裁判 agent 按你事先定好的规则打分。

它解决的瓶颈是「好的标准」无法前置描述。这是典型的品味抉择:四十条不同的结果摆在面前你三秒能挑出最好的那条,但让你先写出优秀的定义,你写不出来。

判断逻辑也简单:问你好的标准,一般你也说不上来,就是感觉这条不行,想要什么你又不知道,就适合这个模式,脑暴往往也是这类

在GTM场景里常见的是:
- 写Hero区域的Slogan
- 开场白
- 落地页 headline
- 冷邮 CTA
- 报价包装的多个变体
- 广告文案的角度测试

常见的Prompt示例:

为这封邮件写 20 个标题
然后由一个独立的裁判 agent 按以下规则逐条打分: 45 字符以内、不含冒号、不是问句、包含一个具体名词。给我得分最高的 5 条和各自的分数, 以及每个标题为什么胜出。

生成者不能兼任裁判,它永远选自己最"标准"的那条
另外,筛选过滤的规则必须可判定:
- ❌ 要抓人
- ✅ 45 字符以内、无冒号、无问句、含一个具体名词

不可判定的规则等于没写。跑完之后去看被淘汰的那 35 条,它们比留下的 5 条更能告诉你你的真实标准是什么

三、【收敛类】从不确定收敛到一个答案
这一类的共同前提:终点不明确。
共同风险:AI 会给你一个看起来收敛了的假答案。

解决方案依旧两种:
⑤ 打淘汰赛 —— 选项已知,要排序
⑥ 循环到成真 —— 步数未知,要跑到真为止

两个分支的区别在于:选项是否已存在。

⑤ 打淘汰赛 —— 选项已知,要排序
结构:并非每一项打绝对分,而是持续两两对决,赢家晋级下一轮。

它解决的瓶颈是绝对分不可靠。同一个 agent 给第 3 份材料打的 8 分和给第 33 份打的 8 分,根本不在一个尺度上。
因为评分会随着流程推进漂移。而相对比较不需要一把稳定的绝对尺子,它只需要在单次比较内部自洽,这个要求更简单,更稳定。

判别逻辑:当你遇到"这些分数看着都差不多,看不出谁真的更好"的时候,就用这个

在GTM场景里常见的是:
- 候选人筛选
- 供应商选型
- 功能优先级排期
- 内容选题排序
- 哪个客户案例该放首页

前置动作:先建评分卡,先给人类看,再让它看第一份材料。 评分卡是人类筛选后的基准标准,而不是AI自己的标准。

常见的Prompt示例:
给这 40 份申请排序。第一步:从这份职位描述里提炼出评分卡,先给我看, 等我确认。确认之后,两两对决地比较候选人,而不是逐个冷打分。 最后除了排名,另外告诉我:我最有可能后悔淘汰掉的是哪两个。

如果不构建评分卡直接比较淘汰,测的只是"谁的材料写得更漂亮"。是AI主观的。
另外,排序真正的价值不在第一名,有时候第一名你自己多半也能猜到,更重要的是在"我最可能后悔淘汰的那两个"。这个问题一定要单独问。

⑥ 循环到成真 —— 步数未知,要跑到真为止
结构:一个带退出条件的循环。跑一轮、检验、没达成就再跑一轮。
它解决的瓶颈是步数未知。正因为不知道要试几次,所以它写不成固定流程,只能写成一个判别条件。

唯一的硬要求:终点必须是一个可验证的真实状态,不是一个步数。

- ❌ 改三轮
- ✅ 直到每条主张旁边都有出处
- ❌ 多试几个原因
- ✅ 直到总数对上

而且成功条件和退出条件必须同时给。 只给成功条件,它跑不出来的时候要么无限转,要么替你编一个假的成功。退出条件的标准写法是"连续两轮没有新发现就停"。

判别方式:你不清楚过程,反正查到对上为止

在GTM场景里常见的是:
- 预测数据和 CRM 对不上
- 归因数据有缺口
- 漏斗数字前后矛盾
- 数据清洗到全部达标

常见的Prompt示例:

预测数和 CRM 里的数对不上。不断提出关于差异原因的假设并逐个验证, 直到有一个能解释这个缺口为止,然后修复它,再验证修复有效。 两个停止条件:总数对上,或者连续两轮没有新发现。跑完告诉我你排除了哪些假设。

如果终点条件本身没法自动验证,这个模式就不成立,退回模式 ③,用人来当那个验证环节。

以上是六种模式,小结一下:

- 按顺序问自己四句话,第一个"是"就是答案:
- 材料已经存在,而且每一项需要不同处理 → ①
- 材料已经存在,每一项处理方式相同,且彼此独立 → ②
- 要造新东西,需要正确 → ③
- 要造新东西,但我说不清什么叫好 → ④
- 选项都有,只是要排个序 → ⑤
- 我连要跑几步都不知道,但结果可验证 → ⑥

组合公式
单个模式解决单一瓶颈,真实的世界往往会选择多种组合(见图2)

最后,关注成本(决定要不要先切片测)

低:① 一个分诊 + 每桶一个处理;⑥ 串行,同一时间只有一个 agent 在跑
中:③ 通常 2–4 个;④ 生成可合批,裁判只需一个
高:② agent 数量等于项目数,四十份材料就是四十个;⑤ 比较次数随规模增长

⑥ 有个特殊性,它单位时间便宜,但总量不可预测,这正是退出条件必须写死的原因。

其余三条省钱原则不变:
- 先跑三个再放开
- 重复性阶段用便宜模型
- 贵的模型只留给合并和裁判这两个真正需要判断的环节

文章在线阅读:newmax.cc
01
Yangyi.
2天前
完全认可
目前可能还没有进入到增量创新场景的阶段
对于存量部分 最容易被规模化解决的部分 一定是从前就如此被解决的
只是用ai杠杆 替代部分人力杠杆

ai替代人类很容易计算ROI
ai增强人类 是比较难计算ROI的
算不明白账 就不好在企业内部落地

企业落地我认为分上下半场
目前处于上半场焦虑付费阶段
分水岭可能会在27年更加明显一些
过渡到下半场绝大部分企业都会价值付费了
价值付费就得算账

yusen: 在企业里面能跑起来的 AI 场景,可以类比之前能够被大规模外包出去的场景。比如说客服中心、非核心系统开发、数据收集和处理这几个场景,之前在美国外包给印度公司都已经很成熟了,现在也是 AI 企业服务公司落地发展得比较好的领域。 相反,如果一个领域之前没有被大规模的外包化,尤其是企业的核心业务流程,那可能用 AI 来替代也是有很多挑战的。这并不是说模型不够聪明,恰恰相反,很多可被外包的职能并不需要顶级智能。瓶颈往往在于业务系统整合、上下文获取、数据清洗和标注、权限控制、利益范围划分等。而过去几十年的外包产业,其实已经替企业完成过一次这样的组织工程:把原本嵌在企业内部的人类工作,变成可以由外部组织调用的服务接口;明确什么数据可以开放、什么权限可以授予、结果如何验收、异常如何升级、责任如何划分。 外包本质上是把外部的人类智能 API 化接入企业。一个职能能够被大规模外包,意味着它在企业里的组织接口已经相当成熟。到了 AI 时代,只要把这个接口后面的人类执行者逐步替换成 AI,改造成本自然比那些从未被接口化的核心业务低得多。

00
Yangyi.
2天前
首页加一条 Instagram Stories 式的横滑条 转化率 +15.44%

某电商品牌的改动:
- hero 区上方加一行圆形、可横向滑动的产品气泡;
- 每个气泡是产品图 + 以结果为导向的标签:「Lean Protein」「Gut Health」「Clean Energy」;
- 每个气泡链接到对应的品类集合页。
- 结果:转化率 +15.44%,品类页浏览 +6.51%,客单价(AOV)持平。

有意思的地方在标签用词:
不是"蛋白粉""益生菌"这类产品品类名,而是"精瘦蛋白""肠道健康""干净能量"这类用户想要的结果。

导航设计从"我们卖什么"改写成"用户想解决什么",从而降低了摩擦。
03
Yangyi.
9天前
早期的ai时代
是ADHD的红利窗口
因为ADHD更适合探索型的创新任务
且注意力极度分散
更适合开5-8个窗口并行跑任务
对任务的精度要求不高
这也很符合ADHD遗忘细节的特性

但当AI的红利期消亡之后
就又会回归到规则节奏中
ADHD的红利期也会随之结束
10
Yangyi.
9天前
其实没必要追求什么GPT5.6,Fable5,Kimi K3
难道你没意识到
这世界上很多人的大脑也都只是一个2B的小模型啊

没外部知识,缺少深度思考,输出质量堪忧
指令简单的时候他理解不了,指令复杂了又记不住出幻觉
上下文窗口极小,说了就忘
多任务无法并发处理
有的还用不明白工具

但其实也一点儿没耽误生活
不是吗
81
Yangyi.
9天前
AI应用层创业的6个优先

- 硬件优先软件
- 国外市场优先国内市场
- 情绪价值优先效率价值
- B端场景优先C端场景
- 领域垂直优先通用智能
- 赚VC的钱优先赚用户的钱

软件&国内&效率&toC&通用&赚用户钱 = 100%纯种大煞笔
如果你选择这个 不如问问为什么不直接选择做培训
75
Yangyi.
15天前
Vibe Coding 八荣八耻

1. 以不看生成代码为荣,以逐行读懂代码为耻
2. 以“做个 App”为荣,以写需求清单为耻
3. 以goal完直接提交为荣,以小步优化迭代为耻
4. 以”跑起来了”为荣,以自动化测试为耻
5. 以密钥硬编码并推上 public repo 为荣,以gitignore环境变量为耻
6. 以“有bug请修复”为荣,以自己定位问题并告诉ai为耻
7. 以复制粘贴甲方反馈为荣,以翻译甲方需求为技术语言为耻
8. 以vibe30个app一分不赚为荣,以做出赚钱app为耻

请熟读并背诵全文,本周五课上默写
20