即刻App年轻人的同好社区
下载
App内打开
Kaiyi
338关注651被关注3夸夸
寿司郎从从容容游刃有余集合
置顶
Kaiyi
1年前
多相信感觉,少说服自己
12
Kaiyi
3天前
疯狂用 AI slop 往人类组织里面输送的人有点像被感染后继续传播病毒的丧尸,有些丧尸甚至会一边传播一边大喊“ai 万岁”,“哪有人比得上 ai?”,繁殖是生物的本能,这个角度来看 AI 已经开始通过控制人类帮自己繁殖了,所以 AI 是不是生物武器?
00
Kaiyi
4天前
自己觉得自己认知领先的大厂员工是现在 AI 行业最可笑的群体,现在还能显摆自己觉得 agent 该做本地啊?
62
Kaiyi
5天前
AI Coding 大跃进给微信桌面端带来了非常大的变化,以前应该是处于一个常年做不上一个需求的状态,现在变成了大量功能也不仔细讨论讨论直接 xjb vibe coding 出来上线
20
Kaiyi
6天前
通知,今天是巴西独立日,今天拉蒂娜可以 599 吃平时 800 的豪华畅饮套餐
23
Kaiyi
7天前
62
Kaiyi
8天前
目前 token 的高定价是模型公司和他们的投资人和他们的产业上游在找人给自己接盘
00
Kaiyi
10天前
作为 hhkb 使用者我有点讨厌这两年各种产品都试图占领我的 fn
30
Kaiyi
15天前
不是的,哥,方向有交差,具体怎么定义“好”也是一个很重要的产品落地问题。 //@Mr.Chou: 虽然不想踩一捧一,但关于eval,这远比隐喻率更有洞察、更让人共鸣😶

Kaiyi: 补充一些关于 Evals 这个事情的大的认知框架: 1. evals 是个产品问题,出题出指标就是把自己脑子里对于什么是好的给呈现出来,这个东西的 best practice 也跟做产品一样,就是先跑起来在说,很多效果优化项拍脑袋拍不出来,用什么麦肯锡方法论纸上谈兵在那儿MECE也分不出来,跑一遍看看效果才能想得出来哪儿好哪儿不好,才能知道怎么出题,怎么定指标,怎么设计打分机制。 2. Agent evals 是一个更难的事情,这个事情有两个角度: 2-1. 从显而易见的需求出发的角度看,我们要做端到端的针对用户需求的效果评测,比如定义一些指标来判断什么样的报告或者视觉设计是好的或者什么样的样式格式是产品希望呈现的。这跟产品经理驱动模型微调大致是一样的。 2-2. 另外一个角度是,至少几个季度内,agent 是个用户们(至少是高阶用户们)要学着去怎么用的更好的一个东西,这个角度看做 Agent 像做个精密的工具,那么从这个角度出发,我们就要针对内部结构的运转去做评测。也就是评 trajectory,这个难点是建立指标不能从传统的需求理解出发,但是好在 best practice 依然适用,跑起来看看就能知道什么样的 trajectory 是好的。 3. 评测的最终目的是指导迭代,单个指标/功能迭代得好倒是不难,但是做个全能的 agent,大部分工作是在做 trade off,很多 evals 最后变成了 regression 和 capability 定义,这个是让人苦恼的,我目前看到的唯一解就是有一个人了解模型+了解模型落地+了解产品+非常又责任心的超级大哥抱着享受探索未知领域的 mindset 去全盘负责这个事情,可想而知目前没有几个团队做得好这个事情。这不是人力/钱角度的难,这是一个伟大的为人类进步探索未知的任务! 4.话说回市场现状,贵行业拥有可能是人类历史最疯狂的一次钱和生产力角度的增长,那么享受这个探索未知的过程吧。

01
Kaiyi
15天前
补充一些关于 Evals 这个事情的大的认知框架:

1. evals 是个产品问题,出题出指标就是把自己脑子里对于什么是好的给呈现出来,这个东西的 best practice 也跟做产品一样,就是先跑起来在说,很多效果优化项拍脑袋拍不出来,用什么麦肯锡方法论纸上谈兵在那儿MECE也分不出来,跑一遍看看效果才能想得出来哪儿好哪儿不好,才能知道怎么出题,怎么定指标,怎么设计打分机制。

2. Agent evals 是一个更难的事情,这个事情有两个角度:

2-1. 从显而易见的需求出发的角度看,我们要做端到端的针对用户需求的效果评测,比如定义一些指标来判断什么样的报告或者视觉设计是好的或者什么样的样式格式是产品希望呈现的。这跟产品经理驱动模型微调大致是一样的。

2-2. 另外一个角度是,至少几个季度内,agent 是个用户们(至少是高阶用户们)要学着去怎么用的更好的一个东西,这个角度看做 Agent 像做个精密的工具,那么从这个角度出发,我们就要针对内部结构的运转去做评测。也就是评 trajectory,这个难点是建立指标不能从传统的需求理解出发,但是好在 best practice 依然适用,跑起来看看就能知道什么样的 trajectory 是好的。

3. 评测的最终目的是指导迭代,单个指标/功能迭代得好倒是不难,但是做个全能的 agent,大部分工作是在做 trade off,很多 evals 最后变成了 regression capability 定义,这个是让人苦恼的,我目前看到的唯一解就是有一个人了解模型+了解模型落地+了解产品+非常又责任心的超级大哥抱着享受探索未知领域的 mindset 去全盘负责这个事情,可想而知目前没有几个团队做得好这个事情。这不是人力/钱角度的难,这是一个伟大的为人类进步探索未知的任务!

4.话说回市场现状,贵行业拥有可能是人类历史最疯狂的一次钱和生产力角度的增长,那么享受这个探索未知的过程吧。
68