即刻App
年轻人的同好社区
下载
App内打开
墨菲腚绿
280
关注
84
被关注
0
夸夸
INFJ-T / 大厂内部创业 / 关注AGI
Agent 很单纯,复杂的是人 🌚
墨菲腚绿
1天前
批判的武器不能代替武器的批判🤕🙊🙈 //
@哥飞
: 真理不在射程内,就在摄程内
枪上花: 很有哲理,不能武力监督,就只能舆论监督。
0
0
0
墨菲腚绿
6天前
AI 很单纯,复杂的是人 🌚
Yinsen: 昨天团队几个实习生结束实习,吃饭时聊到一个问题:AI 时代,人最需要什么能力? 我说,可能是理解世界复杂度的能力。 过去受限于时间和学习成本,人必须专精于某个领域。但越是专精的领域,上下文越有限、边界越清晰,也越容易被 AI 掌握。长期来看,在有限上下文中做判断,可能并不需要人。 真正难的是理解现实世界的复杂性。 AI 也能理解复杂问题,但人有自己的立场、价值判断,以及来自真实生活的大量上下文。这些是 AI 很难完整获得的,也是人的比较优势。 所以未来重要的,可能不只是专业能力,而是理解更大的上下文,在复杂世界中形成判断的能力。 而这恰恰是过去的专业教育很少训练,甚至很少让我们意识到需要训练的能力。
1
1
0
墨菲腚绿
7天前
从前是日益增长的物质文化需求和落后的产能的矛盾。
现在是增长缓慢的需求和飞速增长的产能供给的矛盾。
所以竞争发展成内卷:卷价格,卷情绪价值,卷附加值,卷盘外招。正常的中庸空间被压缩,极化才有机会胜出,几乎必然。
如此的不止电影。
🙊🙈
月光: 看牛来的人,大抵是两种,绝大部分是猎奇和跟风,使自己能够加入热点话题;一小部分是认为这样可以对抗某种资本、监管或者权威之类的假想敌。唯独没有人因为这个电影好看去看,而这恰恰就是问题所在 审美可以多元,哪怕是烂片,观众也可以基于自己对片子本身的审美决定是否去看。而一旦将作品以外的附加因素引入市场竞争,就打开了潘多拉魔盒,出现更多瞄准盘外招的项目 黄片不能上院线,除了公序良俗,同样也是不能将服务性需求这种盘外招引入作品竞争。正如女明星很多人提到,为了作品表达,需要裸露或者性内容都可以接受,但不会拍以此为卖点的作品是一个道理 规则在设立的同时,就为破坏规则者提供了套利空间,而破坏规则的成本,则要全社会为其共同买单
1
0
0
墨菲腚绿
7天前
对于大多数人,做出奥德赛也是小概率事件。做出牛来倒几乎是必然的 🤦♂️
成为苏神(jianlin)是小概率的,但是成为酥神是跳一跳还是能够到的 🌚
_Ezrana: 把《奥德赛》和《牛来》放在一起讨论的人,是没有区分偶然性和必然性事件。《牛来》爆火是偶然性事件,而《奥德赛》是一种必然。 所以人要选择的是,把自己的时间和精力放在一个增加事情发展的必然性的努力之上,还是重仓赌注一些偶然性事件~
1
1
0
墨菲腚绿
7天前
豆包:中性基准预测:3800‑4800万;乐观上限:6500万;悲观下限:2200万
元宝:保守 5000-8000万,中性 9000万-1.2亿,乐观 1.3亿-1.5亿。
GLM5.3:5000 万–7000 万区间,中枢约 6000 万,落至 8000 万以上的概率不足 25%。
千问:最终票房大概率会落在1亿左右。
KimiK3:和 Kimi 聊天的人太多啦,订阅会员可进入独立的优先队列~
🥸🌚🐶🤭😏
哥飞: 如无意外的话,牛来票房估计会止步 3000 万内。现在已经可以感觉到,热度在下降了,票房也在下降,排片也在下降。
0
0
0
墨菲腚绿
8天前
元旦档的“熊出没”会和牛来搞联动吗🤔🐶🥸?
0
0
0
墨菲腚绿
8天前
内容过剩+注意力稀缺
内容极化/分化+渠道触达为王
一部分走向《奥德赛》,另一些变成了“牛来”
1
0
0
墨菲腚绿
8天前
定义标准是一种权力。
莫唯书Mark: 决定AI上限的从来不是算力,是反馈 现在AI写代码越来越厉害,DeepSWE这类评测集里头部模型能达到70%以上的通过率,但同样的模型一旦被扔进真实工作场景成功率就掉到一半以下。 这件事很有意思,一个能独立完成复杂代码改动的AI为什么处理不了采购经理邮箱里的几百封邮件?一个能在开源仓库里跨文件修bug的模型为什么面对电商退货争议就手足无措? 原因其实不复杂,代码的世界有明确的对错边界,编译通过就是通过,测试跑过就是跑过。模型可以自己验证自己,不需要任何人来告诉它对不对,但真实的工作不是这样。 真实工作的任务往往是模糊的、信息是混乱的、边界是流动的,一份有争议的订单需要综合订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间才能决定怎么处理。没有一个标准答案告诉你应该退多少,只有一堆互相矛盾的证据和一堆需要权衡的选项,模型擅长的那个“确定性”不见了。 这就引出了一个更深层的问题,在编程领域AI的数据飞轮可以自己转起来。模型输出代码,编译器给出对错信号,模型据此优化,完全不需要人类介入。但在真实工作领域这个飞轮转不起来,因为“这个决策对不对”没有客观答案,需要人的真实反馈来定义什么是好、什么是差。 这就是RLHF存在的原因,它不教AI什么是正确答案,而是教AI人类更喜欢什么。 所以人类在回路里扮演的角色,不仅仅是AI能力不足时的“替补队员”,它更是定义的来源、反馈的起点。在那些对错说不清楚的领域里,“好”本身就是一个主观判断,没有人就没有标准。 这是AI无法自己解决的困局,它能模仿一切风格,但它不知道人们为什么喜欢某种风格。它能遵循所有规则,但它不知道人们为什么制定了这些规则。它能做出所有正确的动作,但它不知道人们为什么想这样做。它需要大量用户的反馈来告诉它这个是对的,那个是错的。 生成式AI让创作变得廉价,但没有让标准变得廉价。当反馈变得稀缺时,垃圾就会填满空白。 所以当AI生成的内容足够多时,真正稀缺的是keep human in the loop的反馈闭环。谁能让用户主动提供高质量的反馈与判断,谁就能在AI时代占据那个不可替代的位置。
0
0
0
墨菲腚绿
9天前
真实的企业(尤其是稍微大一点的公司)里评测不是技术问题。
太专业了老板说他看不懂,他哪天从外面看了个词就又说你不专业,你专家评测得分数高了,老板说你评的不准,你专家评的分数低了,你要解释为什么低,为什么不能高。最后,效果不好,所有人都可以甩锅评测做得不全面。
把尺子撸得冒火星子,也不能量得更长不是。
所有人都能对评测指手画脚,最后导致评测变成一个很重要,但又没人真拿它当回事的东西。
林阿福Alfred: 今天看到 @yusen 分享关于企业AI的思考有感,也顺着思考中提到外包分享一下最近实践下的一下感受: AI 进入企业的第一步,就像 Yusen 讲的,可以先用 “外包” 来选择场景。 客服、数据整理、非核心研发这些工作,通常边界清楚、输入输出明确、质量容易验收,也已经在相当程度上完成了与企业核心业务和敏感数据的解耦。企业先在这些环节引入 AI,组织阻力最小,也最容易看到成果。 但 “外包” 只能帮助企业完成转型的起步。如果 AI 长期停留在低价值、标准化的执行环节,组织获得的主要还是降本。下一阶段需要沿着价值链向上走,让 AI 逐步进入那些更依赖判断、领域知识和专家经验的环节。 如果想要向上走,企业需要建设一套 “组织级 Harness”。 怎么理解组织级 Harness? 单个 Agent 的 Harness,解决的是如何驾驭 LLM 产生的智能:给模型提供上下文、调用工具、规划任务、检查结果,并在失败后重新尝试。 组织级 Harness 驾驭的对象更复杂,它需要同时协调组织内的 Agent 和人,让两者围绕同一个业务目标协作。它更像一套组织的智能操作系统,比如: Memory 负责沉淀组织的业务背景、历史决策和长期上下文。 Skills 将专家经验和最佳实践封装成可复用的能力。 Orchestration 负责任务拆解、角色分工、流程衔接和异常处理。 权限系统决定 Agent 能看到什么、调用什么,以及哪些动作必须由人确认。 Review 机制负责检查结果、处理高风险决策,并把纠正结果送回系统,作为迭代的养分。 这几个组件连起来之后,企业得到的就不再是几个各自为战的 AI 工具,而是一套能够分配任务、调用能力、积累经验并持续进化的生产系统。 而在这套组织级 Harness 里,我认为最关键、同时也最容易被忽视的部分,是评测,尤其是来自业务专家的评测。 专家经验往往藏在人的脑子里。很多时候,专家一眼就能判断一个结果 “对不对”,却很难直接把判断过程完整地说出来。组织需要把这些隐性的经验逐步拆解成真实案例、判断标准、边界条件和失败样本,让 Agent 的工作质量能够被衡量。 每一次专家对 Agent 的纠正,都应该沉淀为新的评测数据。每一次流程失败,都应该转化为下一轮 Harness 迭代的输入。评测集记录的是组织内对“好”的品味,反馈闭环则让这套标准持续变得更准确。 我现在越来越觉得,建设 AI Native 组织,很像迭代一个 Agent 产品:先选择一个边界清晰的任务跑通,建立评测集和反馈闭环,再逐步提高任务难度、扩展上下文和权限范围,最终进入组织真正创造价值的核心环节。 如果能到这一步, 智能才真正原生地融入了企业。
2
2
0
墨菲腚绿
11天前
供给过剩,需求稀缺。然后呢…?
愤怒中登小丑鱼: 表达过剩,理解稀缺
0
0
0