即刻App年轻人的同好社区
下载
App内打开
墨菲腚绿
280关注84被关注0夸夸
INFJ-T / 大厂内部创业 / 关注AGI
Agent 很单纯,复杂的是人 🌚
墨菲腚绿
1天前
批判的武器不能代替武器的批判🤕🙊🙈 //@哥飞: 真理不在射程内,就在摄程内

枪上花: 很有哲理,不能武力监督,就只能舆论监督。

00
墨菲腚绿
7天前
豆包:中性基准预测:3800‑4800万;乐观上限:6500万;悲观下限:2200万

元宝:保守 5000-8000万,中性 9000万-1.2亿,乐观 1.3亿-1.5亿。

GLM5.3:5000 万–7000 万区间,中枢约 6000 万,落至 8000 万以上的概率不足 25%。

千问:最终票房大概率会落在1亿左右。

KimiK3:和 Kimi 聊天的人太多啦,订阅会员可进入独立的优先队列~

🥸🌚🐶🤭😏

哥飞: 如无意外的话,牛来票房估计会止步 3000 万内。现在已经可以感觉到,热度在下降了,票房也在下降,排片也在下降。

00
墨菲腚绿
8天前
元旦档的“熊出没”会和牛来搞联动吗🤔🐶🥸?
00
墨菲腚绿
8天前
内容过剩+注意力稀缺
内容极化/分化+渠道触达为王
一部分走向《奥德赛》,另一些变成了“牛来”
00
墨菲腚绿
8天前
定义标准是一种权力。

莫唯书Mark: 决定AI上限的从来不是算力,是反馈 现在AI写代码越来越厉害,DeepSWE这类评测集里头部模型能达到70%以上的通过率,但同样的模型一旦被扔进真实工作场景成功率就掉到一半以下。 这件事很有意思,一个能独立完成复杂代码改动的AI为什么处理不了采购经理邮箱里的几百封邮件?一个能在开源仓库里跨文件修bug的模型为什么面对电商退货争议就手足无措? 原因其实不复杂,代码的世界有明确的对错边界,编译通过就是通过,测试跑过就是跑过。模型可以自己验证自己,不需要任何人来告诉它对不对,但真实的工作不是这样。 真实工作的任务往往是模糊的、信息是混乱的、边界是流动的,一份有争议的订单需要综合订单记录、物流扫描、仓库质检、客户对话、现场照片、平台政策和截止时间才能决定怎么处理。没有一个标准答案告诉你应该退多少,只有一堆互相矛盾的证据和一堆需要权衡的选项,模型擅长的那个“确定性”不见了。 这就引出了一个更深层的问题,在编程领域AI的数据飞轮可以自己转起来。模型输出代码,编译器给出对错信号,模型据此优化,完全不需要人类介入。但在真实工作领域这个飞轮转不起来,因为“这个决策对不对”没有客观答案,需要人的真实反馈来定义什么是好、什么是差。 这就是RLHF存在的原因,它不教AI什么是正确答案,而是教AI人类更喜欢什么。 所以人类在回路里扮演的角色,不仅仅是AI能力不足时的“替补队员”,它更是定义的来源、反馈的起点。在那些对错说不清楚的领域里,“好”本身就是一个主观判断,没有人就没有标准。 这是AI无法自己解决的困局,它能模仿一切风格,但它不知道人们为什么喜欢某种风格。它能遵循所有规则,但它不知道人们为什么制定了这些规则。它能做出所有正确的动作,但它不知道人们为什么想这样做。它需要大量用户的反馈来告诉它这个是对的,那个是错的。 生成式AI让创作变得廉价,但没有让标准变得廉价。当反馈变得稀缺时,垃圾就会填满空白。 所以当AI生成的内容足够多时,真正稀缺的是keep human in the loop的反馈闭环。谁能让用户主动提供高质量的反馈与判断,谁就能在AI时代占据那个不可替代的位置。

00
墨菲腚绿
9天前
真实的企业(尤其是稍微大一点的公司)里评测不是技术问题。
太专业了老板说他看不懂,他哪天从外面看了个词就又说你不专业,你专家评测得分数高了,老板说你评的不准,你专家评的分数低了,你要解释为什么低,为什么不能高。最后,效果不好,所有人都可以甩锅评测做得不全面。
把尺子撸得冒火星子,也不能量得更长不是。
所有人都能对评测指手画脚,最后导致评测变成一个很重要,但又没人真拿它当回事的东西。

林阿福Alfred: 今天看到 @yusen 分享关于企业AI的思考有感,也顺着思考中提到外包分享一下最近实践下的一下感受: AI 进入企业的第一步,就像 Yusen 讲的,可以先用 “外包” 来选择场景。 客服、数据整理、非核心研发这些工作,通常边界清楚、输入输出明确、质量容易验收,也已经在相当程度上完成了与企业核心业务和敏感数据的解耦。企业先在这些环节引入 AI,组织阻力最小,也最容易看到成果。 但 “外包” 只能帮助企业完成转型的起步。如果 AI 长期停留在低价值、标准化的执行环节,组织获得的主要还是降本。下一阶段需要沿着价值链向上走,让 AI 逐步进入那些更依赖判断、领域知识和专家经验的环节。 如果想要向上走,企业需要建设一套 “组织级 Harness”。 怎么理解组织级 Harness? 单个 Agent 的 Harness,解决的是如何驾驭 LLM 产生的智能:给模型提供上下文、调用工具、规划任务、检查结果,并在失败后重新尝试。 组织级 Harness 驾驭的对象更复杂,它需要同时协调组织内的 Agent 和人,让两者围绕同一个业务目标协作。它更像一套组织的智能操作系统,比如: Memory 负责沉淀组织的业务背景、历史决策和长期上下文。 Skills 将专家经验和最佳实践封装成可复用的能力。 Orchestration 负责任务拆解、角色分工、流程衔接和异常处理。 权限系统决定 Agent 能看到什么、调用什么,以及哪些动作必须由人确认。 Review 机制负责检查结果、处理高风险决策,并把纠正结果送回系统,作为迭代的养分。 这几个组件连起来之后,企业得到的就不再是几个各自为战的 AI 工具,而是一套能够分配任务、调用能力、积累经验并持续进化的生产系统。 而在这套组织级 Harness 里,我认为最关键、同时也最容易被忽视的部分,是评测,尤其是来自业务专家的评测。 专家经验往往藏在人的脑子里。很多时候,专家一眼就能判断一个结果 “对不对”,却很难直接把判断过程完整地说出来。组织需要把这些隐性的经验逐步拆解成真实案例、判断标准、边界条件和失败样本,让 Agent 的工作质量能够被衡量。 每一次专家对 Agent 的纠正,都应该沉淀为新的评测数据。每一次流程失败,都应该转化为下一轮 Harness 迭代的输入。评测集记录的是组织内对“好”的品味,反馈闭环则让这套标准持续变得更准确。 我现在越来越觉得,建设 AI Native 组织,很像迭代一个 Agent 产品:先选择一个边界清晰的任务跑通,建立评测集和反馈闭环,再逐步提高任务难度、扩展上下文和权限范围,最终进入组织真正创造价值的核心环节。 如果能到这一步, 智能才真正原生地融入了企业。

20
墨菲腚绿
11天前
供给过剩,需求稀缺。然后呢…?

愤怒中登小丑鱼: 表达过剩,理解稀缺

00