即刻App年轻人的同好社区
下载
App内打开
夏虫不可以语冰5533
786关注7k被关注2夸夸
现小红书投资,看 AI 和科技
🌍: 568048220
夏虫不可以语冰5533
9天前

陈皮皮屁: 继续发一则和国内 model researcher 交流的 memo。今天和某模型厂的一位 post-train researcher 聊了聊。Ta 对「国内在 Pre-training 上更有优势、Post-training 相对落后」这件事,补充了一个视角: 国内基本已经「会做」Pre-training 了,但 Post-training 可能还处在一个比较混沌的阶段。 一个核心原因是,两者的 reward 清晰程度很不一样。 Pre-training 的反馈很明确,比如可能就是在单位时间内,把 Next Token Loss 降得越低越好,同时尽可能降低训练成本。 Post-training 要解决的,则是怎么让模型在下游应用中表现得更好。但怎么定义和评估这个「更好」,以及怎么确认模型是真的变强了、而不是在 hacking 某个指标,都非常 tricky。 此外,Pre-training 的创新也更容易被外界看到。 模型架构没有那么强的机密性,一开源大家就能看到,也可以写成 Paper、拿去做 PR。但一家模型公司的数据是怎么清洗的、具体用了什么训练 Recipe,通常不会拿出来讲。 再加上众所周知的缺卡问题,而模型的绝对能力又是模型厂的生死线,大家自然会把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。 Post-training 因此陷入了一个有点尴尬的循环:因为混沌,所以拿不到足够多的资源;又因为资源不够,这种混沌迟迟无法被解决。 除了这个话题,我们还聊到了几个挺有意思的点: 1/ 「大厂最终一定会赢」是一种偷懒的推论。 模型竞争不是比身价。拥有更多钱、卡和人,不等于一定能训出最好的模型。 在这位 researcher 看来,真正起决定性作用的,可能是组织里到底有多少人发自内心想把模型训好,以及组织摩擦会不会消耗掉这些人的热情。(没有说加入创业公司的人会更有梦想的意思。) 2/ Agent 确实已经在替代 AI Lab 里的一部分工作。(所以我们最近和一些 researchers 交流,感觉有些人确实已经有失业焦虑了。) 拿 Infra 举例,现在可以直接告诉 Agent:「每秒只能输出 50 个 Token,请优化到 60 个」,然后让它自己检查 Kernel 和整条链路。 所以一些 Infra 工程师开始自己给自己找事干,比如跑去研究算法、理解训练需求。 (从这里再往外延伸一步:如果说 AI Coding 模糊了产品、研发和设计之间的边界,那么 AI for AI / RSI 似乎也在逐渐模糊数据、算法和 Infra 之间的边界。 3/ Model Research 本身,可能就是最 Science 的 AI for Science。 我们还探讨了两个没有答案的问题,也列在这里吧,欢迎有想法的朋友分享你的见解~ Q1/ 怎么让模型拥有时间概念? 这个之所以会是个问题,是因为如果模型不交卷,它就可以一直保持「我没错」的状态。反正模型不老不死,所以从它自己的视角看,磨洋工可能并不是什么坏事。(GPT-5.6 一直写测试,是不是就是深刻践行了这一点啊 doge.jpg) 就像《葬送的芙莉莲》里,对于一个能活几千年的精灵来说,花十年寻找一枚戒指完全合理。 但我们这些凡胎肉体,根本等不起…(除非 AI 医疗让人类永生哈哈 Q2/ OpenAI 是怎么持续相信 RL 这个方向,并最终把 o1 做出来的? 我们好奇的不是具体的 Recipe,而是背后的组织问题。 想起之前请清华大学叉院的助理教授吴翼录过一期播客,他在节目里提到,OpenAI 很早就在做 RL,但之前做了很久都没有得到结果。 那么,在一个方向连续失败很多年以后,他们的团队为什么还能继续相信它,招到人、说服老板、拿到资源,然后真的把事情做出来呢🤔 这个问题可能需要更了解 OpenAI 的朋友来回答了。 最后,其实跟很多 researchers 交流,尤其是问他们觉得哪家模型更有希望时,大家最后都会强调组织文化。 在一个快速变化、资源永远不够的行业里,怎么把人和算力分给那些还没有答案的创新,以及愿意等这些创新多久,可能和技术判断本身一样重要吧。

00
夏虫不可以语冰5533
11天前
Claude security check 账号一直没法登陆,Upgrade 到了 Kimi Allegretto,真香啊,下决心再也不充 Max 20x了。

结果 Claude security check 结束了,在重置前赶紧问了 Fable 5 几个问题,回答打中了天灵盖,啊!姜还是老的辣!
61
夏虫不可以语冰5533
20天前
史诗级的操作:

Citadel 周二吓唬所有人,说 FOMC 会议期间会有意外加息,周三,整个市场因为加息恐慌而崩溃。

Leopold的仓位基本上了 4x 的杠杆,最后被清算了,Citadel 最终以每美元 40 50 美分的价格买下了 Leopold 的资产。

Leopold 本来这个周末要结婚了,妻子是 Anthropic Chief of Staff。

Ken Griffin 狙击了来自 OpenAI 的天才股神。
30
夏虫不可以语冰5533
21天前
DeepSeek 是中国(甚至全球)模型的成本斩杀线,智谱和 Kimi选择 go up the market frontier 的路线,DeepSeek 走性价比的路线。(文本模型里) 第一个被斩杀的是____。
42
夏虫不可以语冰5533
21天前
美国御三家 post-training 能力: OpenAI Anthropic > Google,pre-training 大致是反过来。比如 Gemini 3 主要是 pre-training 比较强。

中国模型厂 pre-training 的能力: Kimi DeepSeek > 智谱,智谱 pre-training 比较差主要是 infra 弱一些,infra 弱一些主要是 talent 的问题;K3 也是在 pre-training 上挺成功,一把 Scale,K3的 3T Qwen 3.8 Max 3T 不是一个含金量。

Seed 大概在哪?
02
夏虫不可以语冰5533
21天前
吃个饭回来烧了3亿Token,我离日均10亿token只差一个5.6 Sol Ultra
10
夏虫不可以语冰5533
27天前
1/ 一个量化交易员的脑子和习惯, 最大化 P (做成AGI), 而不是 E(收入), 前沿研究叫「摸奖」

2/ 真诚和克制恰好等于最优策略, 推理策略的过程基本就是把纳什均衡算了一遍: AI 的盘子大到可能占 GDP 10%, 想独占的人必然招致全世界的阻力; 你想拿 5%, 就会被只想拿 1% 的人打败,那人又会被只想拿 0.1% 的人打败,只要愿景是多拿,你就先输了

3/ 对技术路线的定义是"阶梯+最省力路径", 每一步踩在上一步上, 并刻意选择"每一步新增工作量最少"的顺序。

4/ 「大模型终将同质化, 终局差距只有成本、时间、体验」 vs 「AI 可以加速 AI 的研究,到后面是非线性的」的矛盾。且后者可能是真正的护城河?

5/ 他内心觉得模型的生意可能等于「比亚迪的电池」, 产品高度标准化最后只能比成本,所以拿比亚迪的电池来论证为啥最后只比拼成本。选比亚迪而不是宁德时代也很有意思。
13
夏虫不可以语冰5533
1月前

傅丰元: 读 Thinking Machines Lab 的最新技术路线博客时,发现他们把汉娜·阿伦特的《人的境况》、迈克尔·波兰尼的「隐性知识」,以及哈耶克关于「分散知识」的讨论,都放进了引用文献里。 Thinking Machines Lab 是 OpenAI 前 CTO Mira Murati 离职后创办的 AI 公司。它在成立几个月后便完成了约 20 亿美元融资,投后估值达到 120 亿美元。 最近,他们发布了一篇博客 《The Future Worth Building Is Human》,介绍自己的技术方向:不只追求更强的通用模型,也希望个人和组织能够继续训练、定制自己的模型,让人的经验、知识和判断参与 AI 的工作过程。 很有意思的是,这样一家站在前沿的 AI 模型公司,在解释技术路线时,引用了不少哲学、经济学和社会思想。 1966 年,迈克尔·波兰尼《隐性维度》 波兰尼提出了「隐性知识」:我们知道的,往往比能够明确说出来的更多。 厨师对火候的判断、工程师排查问题时的直觉、一个团队长期形成的工作默契,都很难完整写进文档或数据库。Thinking Machines 用它来解释,真正有价值的知识常常产生于具体实践,也会随着实践不断变化。 1945 年,哈耶克《知识在社会中的运用》 哈耶克讨论的是「分散知识」:社会中的知识并不集中在某一个地方,而是散落在无数个人、组织和具体场景里。 一家餐厅如何调整菜单,一间商店如何摆放商品,不同组织如何完成同一件事,都依赖身处其中的人掌握的局部知识。Thinking Machines 借此讨论,单一的中央模型很难吸收所有持续变化的经验。 1955 年,约翰·冯·诺依曼《我们能在技术中生存下来吗?》 冯·诺依曼认为,技术中有益和有害的部分总是靠得很近,很难把「狮子」和「羔羊」彻底分开。 Thinking Machines 用这段话讨论模型的开放、所有权和安全:让人拥有更深度修改模型的能力,也意味着这种能力可能被用于不同的目的。 1958 年,汉娜·阿伦特《人的境况》 文章最后引用了阿伦特关于「手段与目的」的讨论。 当一切都只按照效用来衡量时,人也可能变成实现某个目标的工具。只有当人本身被视为目的,所谓的效率、工具和技术,才重新获得意义。 原文: https://thinkingmachines.ai/blog/the-future-worth-building-is-human

00
夏虫不可以语冰5533
1月前
夏虫不可以语冰5533
1月前
终于把我的「Researcher Attention」的 Database 搭完了,跑了近 3000 OpenAI / Anthropic / DeepMind researchers 过去三年的所有 Twitter 内容。已经用 Fable 5 沉浸式聊了俩小时了,找到了一些魔幻三年的因果机理。
34