即刻App年轻人的同好社区
下载
App内打开
Yangyi.
42关注6k被关注7夸夸
🔅推特:Yangyixxxx
🔅分享商业&增长营销
🔅Reverb Marketing
🔅小报童:独立开发/Reddit营销获客增长手册
置顶
Yangyi.
8月前
今天初一,牛马AI如约而至,开启第一波内测
为了限制一下内测范围,点赞转发本内容,评论“参与”
我会逐一给大家发悄悄话邀请内测群,记得查收
感谢每位愿意参与内测给反馈的朋友们🫶
----
长期邀请码:NM-7S6T-VW23
niuma.limyai.com
-----

另外,大家如果问牛马AI和其他AI客户端有什么不一样
我认为它可以说是本地免费版的manus/genspark,是AI时代的人机协同工作台

1、完全适配claude agent sdk并傻瓜安装,支持各类模型接入和本地模型,如果使用本地模型可以完全离线化
2、支持定时任务和AI长期计划,配合看板,人机协同
3、支持绝大部分类型文件的本地渲染和快速编辑处理
4、打通本地应用,比如你可以直接调用seedance生成视频,剪映素材箱立马就渲染出来了,这些素材可以无缝衔接工作流
5、支持飞书,企业微信等webhook机器人通知
6、快速协助用户傻瓜式安装skills
7、用户数据本地绝对安全,AI交互过程只转发不留存,云端没有任何用户隐私敏感数据存储
8、同步进行skills本地查杀和远端审查,进一步保证安全性(目前迭代优化中)
9、本地browser use联动(目前迭代优化中)
594258
Yangyi.
17天前
让ai快速搞了一下x上的推文品牌监控
感觉还挺好用的
22
Yangyi.
19天前
美国人少 所以追求个人英雄主义
中国人多 所以团结一切可以团结的力量

放算力上 前者是英伟达的GPU
后者是华为的Peerium架构

不怕被封锁
堆量大力出奇迹😂
00
Yangyi.
19天前
看大家都在讨论Jev,一起来了解一下

这个模型的特点是由于它的构建模式决定的:

1、输出空间事先由 schema 定义
调用时你先声明"允许的答案是什么",目前主要三类:
- Choice:有限选项中选一个工单归类到 {退款, 技术故障, 投诉}
- Score:数值/量表打分 比如 紧急程度 0–100
- Bool :是/否 + 概率 比如 这段输入是否含 prompt 注入?

因为输出只能落在预定义集合里,所以"不会幻觉、不会类型错误"是结构上的必然

2、并行采样,非自回归
Jev 不是逐 token 生成的 transformer LLM,而是一次前向传播并行给出所有输出。这就是它延迟 70–500 ms(对比前沿 LLM 3–329 s)、快 40–200 倍的根源。

3、训练方法 RLCD(Reinforcement Learning for Calibrated Decisions)

RLHF 优化"人类评分者喜欢的回答";
RLVR 优化"可验证的正确输出";
RLCD 优化"认识论上诚实的概率"——即模型说 80% 置信时,真实准确率就应接近 80%。

这个校准很关键,因为模型输出的置信度可以直接当阈值用(比如 <0.7 就转人工)。

具体逻辑可以看我贴的图

-----------
理解了这个模型,那么不难识别,Jev有四个特别适合它特征的使用场景:
1、问题可枚举
2、量大或高频
3、对延迟/成本敏感
4、置信度能直接当阈值用。

满足其中三条就值得考虑使用Jev

我目前认为特别适合的一些场景:

1. 用户用自然语言写规则的"个人分类器"

过去个性化推荐需要训练排序模型,现在用户一句话"不看引战、不看币圈"就是一个分类器。

可以推广到邮件分拣、通知优先级、评论区管理、家长控制、RSS/新闻聚合。

2. 调用大模型之前的"前置门"

每个 Agent 循环里都有大量廉价判断被浪费在 LLM 上:这个请求要不要调 LLM、走哪个模型(便宜/贵)、要不要检索、检索回来的 chunk 相不相关、这轮工具调用成功没有、任务完成了吗、该不该停下来问用户。把这些交给 Jev,LLM 只在真正需要生成时才被唤醒,整体成本和延迟能砍掉一大截。语义缓存的"命中判断"也属于这一类。

3. 对结构化数据做"语义列"
比如:简历初筛("有 3 年以上 Go 经验?")、合同条款存在性检查、电商评论的属性抽取("是否提到尺码偏小")、客服工单归因、问卷开放题编码、日志/告警的异常标注。特点是:一次性把整张表跑一遍,几分钟、几美元搞定,然后就能用 SQL 查了。

4. 每个请求都要过的安全护栏

Prompt 注入检测、PII 检测、毒性判断、输出是否越权——这些必须在 100 ms 级完成、必须对每条请求都做、误判可以用置信度阈值分层处理(高置信直接拦,中间转人工)。校准过的概率就非常有用。

5. 大规模评测与标注

LLM-as-judge 现在的痛点是又贵又慢,做不到全量。Jev 可以对每条输出打分、比较 A/B 两个 prompt 的偏好、给训练数据打标签、监控线上模型质量。它自己就是靠校准训练出来的,做 judge 的一致性比 LLM 更好。

6. 实时交互和控制

AI玩游戏和交易机器人是这个方向的两端:游戏 NPC 的行为决策、直播弹幕的实时审核、客服对话中的情绪升级检测(该不该转人工)、机器人/IoT 的高层决策、根据用户操作动态调整 UI。共同点是决策必须跟上事件流的节奏。

7. 数据工程中的模糊匹配实体消歧(A 和 B 是不是同一家公司)、跨系统字段映射(这个列对应哪个标准字段)、去重、数据质量分级。这些传统上要么写规则要么训小模型,Jev 用自然语言描述规则就能上,而且能跑全量。
17
Yangyi.
22天前
NewMax移动端基本能用了
不过这苹果本地的tts真的需要升级升级了
这都什么年代的模型……
00:27
40
Yangyi.
1月前
未来其实应该很多东西都本地化了
大家只需要ai做好应用 然后传一下商店
再下载回来 就能直接用本地的ai网关运行它许多场景下已经不需要中间化服务了

我准备把NewMax的手机端功能封装一下
让电脑端也可以连接手机拍照传文件啥的

这样很多原本必须依赖ai token的场景
都可以本地化跑了

我很喜欢本地化
这样数据更独立
而且本地化之后ai可以更懂我自己

如果我必须要把数据发送给某个人
我没得选的话
我只会把他发给ai模型厂商

我不想给任何中间商
包括NewMax

Yangyi.: 我最近在重新看一些易学的书籍 然后突然想搞一个软件 就是拍书 --> OCR --> AI直接帮我出题 -->然后费曼学习让我给它讲解某个概念 然后我想到这个东西要用AI能力 我又不想额外付API的钱 于是就准备让NewMax自己给它自己搞一套应用系统 让他自己做系统的独立应用程序 然后接自己的NewMax网关去调用我的这些AI厂商的订阅服务 而且学习内容还都能留存到本地上 如果你需要发布,还可以发布成应用给别人用 我觉得这东西应该挺刚需的 现在Codex已经在Goal了 如果有这个东西,你希望做个啥? 或者你希望这个应用能支持什么?

00
Yangyi.
1月前
我最近在重新看一些易学的书籍
然后突然想搞一个软件
就是拍书 --> OCR --> AI直接帮我出题 -->然后费曼学习让我给它讲解某个概念

然后我想到这个东西要用AI能力
我又不想额外付API的钱

于是就准备让NewMax自己给它自己搞一套应用系统
让他自己做系统的独立应用程序
然后接自己的NewMax网关去调用我的这些AI厂商的订阅服务
而且学习内容还都能留存到本地上
如果你需要发布,还可以发布成应用给别人用

我觉得这东西应该挺刚需的
现在Codex已经在Goal了

如果有这个东西,你希望做个啥?
或者你希望这个应用能支持什么?
33
Yangyi.
1月前
我觉得彪哥去年有句话含金量在持续提升:
国内生意狗都不做
72
Yangyi.
1月前
人们对需求最大的误解是:
误以为要解决用户的问题
实际上要先解决用户的情绪
27
Yangyi.
1月前
判断一个公司是不是AI Native
我认为有一个指标及其关键
就是这个公司有多少数据是可以被Agent获取使用的

我称之为:智能数据比率

如果一个企业里
各种生产数据,进销存数据,营销投放数据,销售数据,客服数据,全部散落在四处
甚至有的数据还是纸质化的
那么势必会影响Agent获得上下文

如果Agent没有这些上下文
那么就会限制Agent的能力,就很难谈得上「使用」

所以AI Native的第一步,是数字化这些数据
数据的数字化程度越高,就越容易AI Native

互联网公司,数据大部分在系统里
实体公司,可能还需要一些终端设备来收集现实世界数据

如果你公司内的数据,Agent都可以轻松获取
那么你大概是步入AI Native公司的行列了
00
Yangyi.
2月前
企业AI落地我觉得最难的地方在于选择
选择什么场景作为你的第一切入
这个很重要

有些人上来就想做流程数字智能化
那面临的阻力就非常多
往往第一次合作 信任程度又没那么高
推进就会重重受阻 最后烂尾

而且很多制造业企业
线下的进销存可能还靠一个记事本在记录呢
这些都要数字化改造 改造周期就非常久

做这个选择我觉得就三个点:
1、对老板而言,老板认为是一个很重要的场景
2、对协作而言,最好是可独立完成的场景,依赖项少
3、对产出而言,最好是有明显提升的场景

把这三项一交叉,交点很容易就发现
那就是做营销获客

找到一个非常非常小的单点,哪怕提升一点点,都可以
这种场景不太依赖系统协作,甚至一个人就能完成
但是给出的结果,是有系统产出的,有ROI变化的
有成绩,先建立信任,拿结果,当信任累积了,后面推进会变得容易

上来就想一口气吃个胖子,高举高打,到最后往往是一地鸡毛

所以在NewMax上我思考的结果就是
营销场景做的足够深 就是最大的差异化了
33