即刻App年轻人的同好社区
下载
App内打开
夏虫不可以语冰5533
793关注7k被关注2夸夸
现小红书投资,看 AI 和科技
🌍: 568048220
夏虫不可以语冰5533
12天前
Name it to tame it = (对待情绪的方式是)命名即驯服
00
夏虫不可以语冰5533
1月前
The art of bet everything on yourself.
00
夏虫不可以语冰5533
2月前
晚上睡前打算听点深度内容辅助入睡,想起@董慧hui 说,这一期聊了七个小时,非常深度,也想学习下小晚的访谈,点开了Liblib这一期。

结果我听了一个小时越听越清醒,还笑喷了: “有两个人给我们说你的口头禅是做不了就滚”,“半夜打电话给顺为的投资人哭”,“产研团队后院起火”。
21
夏虫不可以语冰5533
2月前

陈皮皮屁: 继续发一则和国内 model researcher 交流的 memo。今天和某模型厂的一位 post-train researcher 聊了聊。Ta 对「国内在 Pre-training 上更有优势、Post-training 相对落后」这件事,补充了一个视角: 国内基本已经「会做」Pre-training 了,但 Post-training 可能还处在一个比较混沌的阶段。 一个核心原因是,两者的 reward 清晰程度很不一样。 Pre-training 的反馈很明确,比如可能就是在单位时间内,把 Next Token Loss 降得越低越好,同时尽可能降低训练成本。 Post-training 要解决的,则是怎么让模型在下游应用中表现得更好。但怎么定义和评估这个「更好」,以及怎么确认模型是真的变强了、而不是在 hacking 某个指标,都非常 tricky。 此外,Pre-training 的创新也更容易被外界看到。 模型架构没有那么强的机密性,一开源大家就能看到,也可以写成 Paper、拿去做 PR。但一家模型公司的数据是怎么清洗的、具体用了什么训练 Recipe,通常不会拿出来讲。 再加上众所周知的缺卡问题,而模型的绝对能力又是模型厂的生死线,大家自然会把更多资源投入反馈更明确、也更容易获得声量的 Pre-training。 Post-training 因此陷入了一个有点尴尬的循环:因为混沌,所以拿不到足够多的资源;又因为资源不够,这种混沌迟迟无法被解决。 除了这个话题,我们还聊到了几个挺有意思的点: 1/ 「大厂最终一定会赢」是一种偷懒的推论。 模型竞争不是比身价。拥有更多钱、卡和人,不等于一定能训出最好的模型。 在这位 researcher 看来,真正起决定性作用的,可能是组织里到底有多少人发自内心想把模型训好,以及组织摩擦会不会消耗掉这些人的热情。(没有说加入创业公司的人会更有梦想的意思。) 2/ Agent 确实已经在替代 AI Lab 里的一部分工作。(所以我们最近和一些 researchers 交流,感觉有些人确实已经有失业焦虑了。) 拿 Infra 举例,现在可以直接告诉 Agent:「每秒只能输出 50 个 Token,请优化到 60 个」,然后让它自己检查 Kernel 和整条链路。 所以一些 Infra 工程师开始自己给自己找事干,比如跑去研究算法、理解训练需求。 (从这里再往外延伸一步:如果说 AI Coding 模糊了产品、研发和设计之间的边界,那么 AI for AI / RSI 似乎也在逐渐模糊数据、算法和 Infra 之间的边界。 3/ Model Research 本身,可能就是最 Science 的 AI for Science。 我们还探讨了两个没有答案的问题,也列在这里吧,欢迎有想法的朋友分享你的见解~ Q1/ 怎么让模型拥有时间概念? 这个之所以会是个问题,是因为如果模型不交卷,它就可以一直保持「我没错」的状态。反正模型不老不死,所以从它自己的视角看,磨洋工可能并不是什么坏事。(GPT-5.6 一直写测试,是不是就是深刻践行了这一点啊 doge.jpg) 就像《葬送的芙莉莲》里,对于一个能活几千年的精灵来说,花十年寻找一枚戒指完全合理。 但我们这些凡胎肉体,根本等不起…(除非 AI 医疗让人类永生哈哈 Q2/ OpenAI 是怎么持续相信 RL 这个方向,并最终把 o1 做出来的? 我们好奇的不是具体的 Recipe,而是背后的组织问题。 想起之前请清华大学叉院的助理教授吴翼录过一期播客,他在节目里提到,OpenAI 很早就在做 RL,但之前做了很久都没有得到结果。 那么,在一个方向连续失败很多年以后,他们的团队为什么还能继续相信它,招到人、说服老板、拿到资源,然后真的把事情做出来呢🤔 这个问题可能需要更了解 OpenAI 的朋友来回答了。 最后,其实跟很多 researchers 交流,尤其是问他们觉得哪家模型更有希望时,大家最后都会强调组织文化。 在一个快速变化、资源永远不够的行业里,怎么把人和算力分给那些还没有答案的创新,以及愿意等这些创新多久,可能和技术判断本身一样重要吧。

00
夏虫不可以语冰5533
2月前
Claude security check 账号一直没法登陆,Upgrade 到了 Kimi Allegretto,真香啊,下决心再也不充 Max 20x了。

结果 Claude security check 结束了,在重置前赶紧问了 Fable 5 几个问题,回答打中了天灵盖,啊!姜还是老的辣!
61
夏虫不可以语冰5533
2月前
史诗级的操作:

Citadel 周二吓唬所有人,说 FOMC 会议期间会有意外加息,周三,整个市场因为加息恐慌而崩溃。

Leopold的仓位基本上了 4x 的杠杆,最后被清算了,Citadel 最终以每美元 40 到 50 美分的价格买下了 Leopold 的资产。

Leopold 本来这个周末要结婚了,妻子是 Anthropic 的 Chief of Staff。

Ken Griffin 狙击了来自 OpenAI 的天才股神。
30
夏虫不可以语冰5533
2月前
DeepSeek 是中国(甚至全球)模型的成本斩杀线,智谱和 Kimi选择 go up the market 走 frontier 的路线,DeepSeek 走性价比的路线。(文本模型里) 第一个被斩杀的是____。
42
夏虫不可以语冰5533
2月前
美国御三家 post-training 能力: OpenAI ≈ Anthropic > Google,pre-training 大致是反过来。比如 Gemini 3 主要是 pre-training 比较强。

中国模型厂 pre-training 的能力: Kimi ≈ DeepSeek > 智谱,智谱 pre-training 比较差主要是 infra 弱一些,infra 弱一些主要是 talent 的问题;K3 也是在 pre-training 上挺成功,一把 Scale,K3的 3T 和 Qwen 3.8 Max 的 3T 不是一个含金量。

Seed 大概在哪?
02
夏虫不可以语冰5533
2月前
吃个饭回来烧了3亿Token,我离日均10亿token只差一个5.6 Sol Ultra
10
夏虫不可以语冰5533
3月前
1/ 一个量化交易员的脑子和习惯, 最大化 P (做成AGI), 而不是 E(收入), 前沿研究叫「摸奖」

2/ 真诚和克制恰好等于最优策略, 推理策略的过程基本就是把纳什均衡算了一遍: AI 的盘子大到可能占 GDP 10%, 想独占的人必然招致全世界的阻力; 你想拿 5%, 就会被只想拿 1% 的人打败,那人又会被只想拿 0.1% 的人打败,只要愿景是多拿,你就先输了

3/ 对技术路线的定义是"阶梯+最省力路径", 每一步踩在上一步上, 并刻意选择"每一步新增工作量最少"的顺序。

4/ 「大模型终将同质化, 终局差距只有成本、时间、体验」 vs 「AI 可以加速 AI 的研究,到后面是非线性的」的矛盾。且后者可能是真正的护城河?

5/ 他内心觉得模型的生意可能等于「比亚迪的电池」, 产品高度标准化最后只能比成本,所以拿比亚迪的电池来论证为啥最后只比拼成本。选比亚迪而不是宁德时代也很有意思。
13