即刻App
年轻人的同好社区
下载
App内打开
糯.米.鸡
213
关注
860
被关注
3
夸夸
一创业公司ai产品 ex美团光年AI产品
为AI构建它的native产品中🥰
置顶
糯.米.鸡
7月前
这篇文章断断续续写了两个星期,中间沉淀了些认知,爬了不少数据,用openclaw为引子试图把自己对 AI 产品的一些困惑理清楚。写的过程中有些东西越想越明白了,也有些越想越觉得之前想的不对。也借此机会给自己写了篇我自己的2026年AI产品理念指北
万字解析 | 从 OpenClaw 出发,重新理解 AI产品
51
5
17
糯.米.鸡
18天前
写得真好。感觉对于 broswer 或者类似长链连续任务,system1 模型能不能知道自己行不行还挺重要,能够合适时正确交给 system2
敖特_Aute: 同事问我对 Jev 在 Broswer use 领域的应用有什么看法? 答(一些比较初步的感受,不代表未来观点不会变): Jev 我理解是以输出通用且有限的分类为目标所训练与架构的,在类似任务下相对自回归生成结构化文本的 LLM 有很大速度优势。 目前看起来有几个限制: 第一,每次调用前需要准备好候选选项,虽然可以动态生成,但候选难以枚举或者数量太多时,就需要额外处理,常规的文本生成更不是它的适用范围; 第二,分类不是百分之百准确的,和 LLM 一样,也受限于模型规模、训练质量等影响; 所以具体到 Broswer use 这样的通用任务,我觉得还是要讨论讨论。 具体可以从两个维度分析:单次动作的可选范围,以及单次动作的推理难度。 从可选范围来看,一个页面的可交互元素,乘以每个元素的可交互方式,比如点击、输入、拖拽等,如果全部平铺,很容易把选项撑爆。Jev 目前单个 Choice 最多支持 255 个选项。把操作和目标拆开可以缓解,但某一类操作的目标仍然可能太多。 从推理难度来看,浏览器任务里有大量操作,单步推理难度是不高的。Jev 更适合的 System 1 任务,我凭感觉可能占很大比例,大多数情况下应该超过 90%。 举个例子,在网页上购物,商品、金额等都已经确认,走到结算这一步,页面上有个支付按钮,需要点它,确实就只是 System 1 难度的动作。 但换个例子,页面上有一道复杂的数学选择题,只有三个选项。这时候选谁,就无法离开 System 2 进行推理。选项少,不代表问题简单。 当然,Jev 分类这种输出形式本身不意味着没有推理能力。但 Jev 官方确实列出了多跳推理、精确数值处理等弱项。考虑到浏览器是一个通用容器,需要调动 System 2 能力的任务一定是无法避免的。 那么,选项撑爆和 System 2 介入这两个问题要如何解决? 选项撑爆 可以通过工程手段把候选分页,留出“下一页”“上一页”;也可以逐级选择,比如先选页面区域,再下钻到具体元素,最后选择操作。还可以先给候选打分,筛选后再做最终选择。这些方式可以配合使用。 System 2 介入 可以给模型一个类似“不确定”的选项,或者根据概率和置信度,让 LLM 接管。理论可行,但可靠性需要验证 另外,动作拆分的粒度也很重要。如果把鼠标操作拆成方向加步长,靠多轮交互逐步修正,点一个按钮可能要来回很多轮,不一定比 LLM 更快。 公司里应该有部分同事,包括我,是从上一个时代的 AI 公司过来的。我们当时做的很多工作,核心就是训练模型做分类,所谓的模式识别。 因此上面列出这些问题,大都在上一代模型和系统里就有一些解决思路,总体上就是先缩小候选范围,再逐级细分。我个人其实觉得这些方案并不优雅,因为分组、筛选、纠错、升级的复杂度最后还是落到了外围工程上。 相较于传统分类模型,Jev 当然有巨大进步,可以理解自然语言描述,处理运行时定义的候选,还能并行回答多个问题。但在具体任务上的表现,是否能追平专门为该任务训练的分类模型,我持怀疑态度。对于方向加步长这样的低层控制任务,我也没有看到足够的公开评测来证明它的泛化表现。 具体到 Broswer use,如果既要维护分类模型的候选空间,又要编排它和 LLM 的分工,处理不确定性、模型切换和失败恢复,这种组合,在我看来,似乎不如直接用一个速度很快的 LLM 来得优雅。 当然,架构是否优雅不优先于实际业务表现。多模型组合省下的推理时间,能不能覆盖候选处理、额外轮次和模型切换的开销,最终还是要看任务成功率、总延迟和总成本。
10
0
0
糯.米.鸡
27天前
我真的看不懂 Codex 每次甩来一整坨黑话。受 Grok Bot 和 Instinct 的聊天体验启发,做了个很小的简单 Pi 插件:Human Message。Agent继续在背后调用工具、把事情做完;这个插件让AI它自己控制什么时候该发消息了,什么时候安静做事,什么时候回一句,什么时候自然分成两三条消息。已开源:
github.com
00:08
18
1
2
糯.米.鸡
2月前
可能是之前也有类似想法,昨天看到DeepSeek harness 还挺触动,下班回来后老想着事儿 熬了个小夜写了这篇公众号,叫 DeepSeek harness可能是一个更适合大众的产品形态(虽然感觉这是一个非常容易挨骂的理解哈哈)。不论是 codex 啊 dsh 啊,大家一点点摸索,这么通用的智能怎么去驾驭,怎么能让更多人享受到 agent 的帮助
DeepSeek Harness可能是一种更适合大众的产品形态
6
1
0
糯.米.鸡
3月前
最近也在更加认真地认识自己,原来的像 MBTI 等等量表式的评测实在有点感觉不知道怎么选,想想都 AI 时代了有没有更好的大家的心理测。我摸鱼做了一个小网站和 skill用 AI 的方式写写故事,来做更好的自我理解。欢迎来玩 来试试
→ 网站: storylens.me
→ 开源 skill: github.com/1zhangyy1/storylens-reading-skill
写写故事,和 AI 重新认识了一次自己
9
0
0
糯.米.鸡
3月前
认可,我觉得个人也要刻意避免这样的想法和表达,一般说“ A 这不就是 B” 的,通常是既不懂 A,也不懂 B,且用“这不就是”这样的语句往往会给自己已经看懂的错觉。说多了往往就丧失了很多东西真切理解,登味就上来了
treeyeert: 如果有人跟你讨论问题的时候总是说“这不就是 xxx 么?”且后续没有任何解释与论证,那你可以跟他在这个话题上拜拜了。
7
1
1
糯.米.鸡
6月前
做了个小工具,便携式 AI 智能体配置打包与共享工具
AgentBox 将你的 AI 智能体完整环境(设置、技能、记忆、会话)打包成一个便携文件,可以在项目、机器和团队之间共享(目前只做了claudecode版本的,后续看看加上codex和openclaw的适配和三者互转)
github.com
34
7
14
糯.米.鸡
7月前
安卓目前还没有,安装后扫码提示我更新,更新后还是8.0.69哈哈,安卓还是低人一等哈哈
哥飞: 没被灰度到
4
2
2
糯.米.鸡
7月前
做了个目前超超超好用的ppt skill,覆盖ppt的完整流程,从零散信息到大纲到ppt到后续去dokie.ai网站微调
完全交互式的 HTML 演示文稿,支持动画、可点击交互,甚至 3D 模型等等
有超多主题支持好看的设计
有方便查看预览ppt的预览页面
github.com
,
欢迎多多来玩!
终于敢把AI做的PPT发给老板了!超好用的 AI PPT Skill!
80
12
41
糯.米.鸡
1年前
最近在做一个多模态创造agent,下午和它聊聊天,看看它给我讲的猫届抖音裁员脱口秀视频哈哈
04:08
14
0
1