即刻App年轻人的同好社区
下载
App内打开

科技圈大小事

今天科技圈又发生了什么重要事件?订阅该主题就能知晓。

100万+人已经加入

  • 阑夕ོ
    2天前
    半个月前,「晚点LatePost」以姚顺雨入职腾讯300天为题写了篇深度稿,不出意外的刷了一波屏,也算是新的混元团队对外做了一次系统性汇报。

    不过很少有人注意到的是,就在第二天,「Z Finance」也发了一篇关于微信WeLM加大技术成果宣传的报道,直言这是腾讯AI在混元之外的「第二条线」。

    时隔多年,又双叒叕看到似曾相识的赛马画面,这我可就一点儿都不困了啊⋯⋯

    WXG(微信事业群)在腾讯内部的独立地位,从来不是秘密,在大模型这件事情上,微信也有自己的考量,自研大模型WeLM今年开始突然积极「营业」,就是一个再明显不过的信号。

    根据媒体透露,在今年的腾讯年会上,微信团队是找集团表态了的,要求提供更多GPU来训练模型,这在当时集全公司资源支持元宝的背景下,显得非常「没眼力劲」。

    但是比较让人意外的是,凭借远远不如混元的算力资源,微信在大模型上交的答卷,其实⋯⋯还挺厉害的:

    基于微信和混元各自最新发布的模型自测结果,在7项重叠指标上,WeLM有6项领先于HY 3,而且这还只是WeLM-617B,并不是Hidden Decoding的完全体,而HY 3已经是正式版了,两个模型都是7月发的。

    就很反直觉,对不对?

    要知道,混元最近再次完成了一轮整合,把多模态并入了大模型部门,再加上Infra,三条线全部交给姚顺雨统一管理,这种程度的权力倾斜在腾讯的公司史上也是很少见的。

    气氛都烘托到这里了,然后HY 3没打过WeLM,这就有点尴尬了。

    再说一个很有意思的,微信和混元的赛马场面看起来十分激烈,但实际上,属于字节一队和字节二队在前线火拼。

    微信WeLM的模型架构负责人张思钧,是从字节Seed Model团队过去的,WeLM之所以在主打成本效益的MoE路线上建树颇丰,就是因为他把Seed极致工程化的强项带过去了。

    我甚至看到有Seed的同学说,WeLM更新的博客文章里,有几个技术构想很眼熟,都是张思钧之前当同事时尝试过的⋯⋯

    此为字节一队。

    至于另一边的「熟人」就更多了,姚顺雨手底下都快被字节Seed出来的人包围了,包括RL Infra组负责人张弛、RL算法组负责人袁钰峰、直接协助姚顺雨的肖学锋等等,全是核心板块的坑位。

    他们集中在2025年底到2026年初这个时间段入职,属于姚顺雨「刷脸」成功的结果,用于补强混元模型的基础能力。

    此为字节二队。

    所以四舍五入,微信和混元突然开始内部赛马,本质上是字节一队和字节二队在暗地里较劲,而且目前还是一队暂时领先二队。

    要知道,字节Seed的AI人才密度之高,已经是行业里公认的事实了,他们的外溢流动,大多始于心志勃发,想在一个更缺骨干——当然也意味着更有向上空间——的新系统里快速爬升。

    戏剧性的是,这些散是满天星的「SSR碎片」,同时被腾讯集齐了,并在内部阴差阳错的形成了两个对垒的阵营,一队去了微信,二队去了混元。

    而从过往经验来看,内部赛马这件事情,总体而言依然是利大于弊的,弊端无非是一些可以预见的资源浪费,但和保持组织活性的收益相比,可以说是微不足道的。

    就像微信当初是从广州跑出来的,王者荣耀则是成都团队做的,腾讯做产品是有从边缘到中心这种传统的,AI战事才刚开了个头,已经属实格外精彩了。

    根据高盛6月发布的一份研报,WXG和TEG并行开发模型的结构一时半会儿是不会变的,混元挂靠在TEG,同时TEG的总裁也是负责分配算力的拍板人,优势很大,但WXG硬是凭自己的模型表现上了桌,加上微信手握14亿月活的大场景,哪边更有话语权还真说不好。

    我的感觉是,微信确实有打差异化的心思,提前走位规避所谓「重复造轮子」的质疑,比如会反复强调资源效率,要用更经济的方式去探索AI服务。

    这既可以理解为卡量有限的不得已选择,也能代入到微信对于自身用户规模的谨慎,但是无论如何,这种特殊性,给WeLM从训练到推理全链路自建提供了充分的理由。

    大概率,WXG不会让TEG进来处理微信的数据,主权问题,不容谈判。

    但我也想不出来,混元能够抛开微信把腾讯AI做得风生水起的画面。

    腾讯在WAIC的展台我是去了的,亮相的AI产品全家桶几乎都是姚顺雨在内部推动「协同」之后的友军,唯独微信只放了一个表情包生成设备,画风迥异。

    不知道你们会如何看待这两条AI管线的未来?

    还是那句话,竞争,尤其是向上的竞争,是好事,这是「经济上行的美」不可或缺的风景线。
    1043
  • 阑夕ོ
    3天前
    美国的两难问题:卖英伟达的芯片,就会眼睁睁助长中国大模型公司不再受困于算力瓶颈,不卖英伟达的芯片,就只适得其反的看着自己最想掐灭的华为逐渐实现国产替代,以实际行动削弱铁拳的权威。

    这不是我说的,观点来自「华尔街日报」刚刚刊出的深度报道「中国全力追赶美国AI芯片的内幕」,考虑到采写时间,这篇稿子肯定没有赶上梁文锋的那段讲话,却非常准确的呼应了讲话里的核心信息,那就是中国芯片产业本质上是美国一手「帮助」建立起来的:

    - 3年前,在接连遭到光刻机和芯片的禁售打击后,由国务院排名第一的副总理牵头,中国重启了对标20世纪60年代中苏关系破裂之后自主制造原子弹的全面动员模式,组建了一个高规格委员会,开始打造关键芯片领域的国产供应链;

    - 这不是中国第一次试图建设自主芯片产业,但多次受制于腐败、投机和套补贴等问题,这次政府决定纠正错误,不再只用产业政策这一项工具,资本市场也被纳入进来,借助「看不见的手」调控优劣,即便是华为,要和其他芯片公司竞争;

    - 在第一年里,计划并不顺利,市面上的国产芯片几乎都无法稳定训练大模型,而工程师们已经习惯了英伟达的生态,遭到禁售的GPU也通过第三国转运等方式,被用在了AI大厂的作业里,政府开始引入更多的专家协助制定决策;

    - 转折出现在2025年,主要是两件事情,其一是华为造出了昇腾950,性能非常出色,同期阿里巴巴的平头哥等公司也都提交了自研芯片的乐观报告,其二是美国的得意忘形,在获批可以卖给中国H20后,美国商务部长在电视上公然宣称允许中国购买英伟达「第4好」的芯片,这让中国倍感羞辱,并要求企业停止采购英伟达产品;

    - 夹在中间的英伟达就很难受了,既要游说华盛顿抬高枪口,又得面临北京的不确定性,去年年底好不容易争取到了H200的出口权,但中国市场也没那么傻白甜了,企业被要求只能在必要时才能下单H200,而且必须配货采购更多的国产芯片,进一步刺激国产替代的产能;

    - 华为的最新报告显示,中国对于海外芯片的依赖已经从2021年的90%降低到了2025年的60%以下,且有信心在2030年压缩到25%,华为的高管直言——「如果不是美国把我们的国家、行业和公司逼至绝境,我们永远做不出如此成就」;

    - 华为的进展催生出一些新的信号,比如拒绝使用国产芯片将成为一种政治事故,重要的是这也并非无中生有,中国科技公司的管理层确实感受到了本土芯片的变化,打破了以前认为完全无法取代英伟达的固有思维,越来越多的团队开始尝试用全国产化的生产环境来训练大模型;

    - 当然,一切的终点都会回到EUV光刻机这个命门上,华为是在用相对落后的DUV光刻机来生产芯片,并用各种堆叠式的工艺创新来突破限制,这会不可避免的降低生产效率,只有自研出EUV光刻机才能海阔天空,这非常难,但如果真实现了,那可就是秦始皇摸电门喽。
    5829
  • 阑夕ོ
    1天前
    卧龙凤雏,得一可安天下,新能源行业却又何德何能,可以二者兼得。
    3214
  • 鲁彼特
    2天前
    现在网上在盛赞王虹导师有多好,目送学生万丈光芒——好像只要有了这样的导师,每个人都能辉煌一样。

    其实王虹最应该感谢的人是她自己。

    ​如果一个人自己不想改变,再好的外部支持也是白搭。

    就是因为她没有放弃自己,外部良性的助力才接的进来。

    ​我们从王虹身上最该学的是:

    永远不要低估自己的潜力。

    相信潜意识为自己指的那个方向。

    去寻找最适配、最能哺育它的环境。

    东方不亮西方亮,天下之大任我驰骋。

    而不是反过来,为了适配环境磨平棱角,放弃自己的理想,把妥协误以为是成熟!

    在这样一条路上,不要指望别人先来拯救(联系)自己。

    ​你自己要先迈出那一步。

    You are your own master!

    51
  • Max_means_best
    2天前
    卧槽,美股半导体被中国光刻机砸盘了。。

    据The Information报道,中国一家国资背景企业已经开始小批量生产国产浸没式DUV光刻机。

    今年预计生产约5台,2027年增加到20台,计划交付给中芯国际、华虹和长鑫存储。

    机器目前在性能、可靠性和制造质量上仍然落后于ASML,距离真正成熟还有很长一段路。

    只看这几个数字,市场似乎确实反应过度了。

    5台机器,性能还不如ASML,怎么可能威胁一家垄断全球高端光刻机市场几十年的公司?

    但资本市场交易的是未来。

    实验室里造出一台样机,只能证明技术路线勉强可行。

    真正送进中芯、华虹和长鑫的生产线,经过精度、稳定性、良率和设备兼容性的长期验证,再根据客户反馈不断修改,才意味着国产光刻机开始建立完整的产业迭代闭环。

    第一批机器可能很差,产量也少得可怜。

    但只要能够在晶圆厂里跑起来,后面就会产生真实数据、客户反馈、供应链订单和工程师经验。

    下一代机器的研发,也终于不用继续对着实验室参数闭门造车。

    更关键的是,西方每收紧一次出口限制,都在替国产设备创造一个必须被使用、必须被改进的市场。

    ASML短期内依然没有真正的对手。

    中国国产EUV目前也还停留在原型阶段,浸没式DUV今年预计只有约5台产量。

    但ASML在中国市场的垄断,已经出现了一条可以持续扩大的裂缝。

    所以今天半导体跌的,并不是这5台机器对应的订单。

    它跌的是一条过去只存在于新闻和PPT里的国产替代路线,第一次真正开始进入晶圆厂。

    一台性能更差的机器不足以威胁ASML。

    一条能够持续获得订单、数据和客户反馈的国产供应链,足以让市场重新定价。
    107
  • 阑夕ོ
    9天前
    总结一下逛完今年WAIC的51件小事:

    1、「三地四馆」的场地太大了,根本没办法全图鉴,加上高峰人流期的交通管制能拉到馆外一公里之远,日均步数4万+的消耗,非常折磨,不过人也是真多,感觉我大半个朋友圈都来了;

    2、应该是WAIC举办以来参展企业最多的一届,而且多了一些「很占地方」的展品,比如华为、沐曦和摩尔线程都把自家的万卡集群搬到了现场展示,感觉走过去就会自动响起「加油华为,加油China」的BGM;

    3、但是因为那些万卡集群本身并没有交互功能,只能看到闪烁着指示灯的服务器堆叠在一起,所以画面非常静止,空有人气——尤其是华为的展区——却也没有任何节目效果,人群围在一起很像某种原始崇拜,「太空漫游2001」里猿人们膜拜黑色石碑的即视感;

    4、具身智能仍然是最热展区,没有之一,很多人特意跑一趟就是为了来看机器人的,单论世博主场馆,具身智能这条赛道的占地比例差不多是其他企业的总和,大有以一敌十之势;

    5、机器人的密度之高、同行之卷已经到了一个新等级,像是宇树以前靠几场跳舞打拳就能刷屏已经行不通了,今年都在努力证明可以帮人泡茶炒菜按肩膀,「我有实用价值」的生存欲爆炸;

    6、当然宇树依然是里面最有排面的一家,载人机甲GD01占据着整个主场馆的入口C位,过了安检就能看到,据说王兴兴还在现场展示了一波操作,不过我没赶上;

    7、至于担心机器人取代工作的,可以稍微宽心了,即便工作人员有各种方法把遥控器藏在包里,光从动手效率来看,这些机器人的单位时间——包括把不用睡觉也考虑进去——产出还是远远比不过日结老哥的;

    8、这么说吧,不少机器人演示怎么干活的对外视频都是调了倍速的,因为不调的话很容易被误以为是慢动作,让看的人急得不行;

    9、有一说一,在现阶段,「做对」比「做快」要重要得多,比较震撼的还是中国具身智能整个行业的「钢铁洪流」面貌,眼瞅着又要以一国之力对战全世界了;

    10、有家给机器人做「皮肤」的公司一目科技还挺有意思的,它只做触觉传感器,像一层膜那样贴在机器人的肢体末端,提供准确的「手感」反馈;

    11、京东也在具身智能这边上桌吃饭,想不到吧,它好像找到了一种类似数据标注的定位,主打人类视角数据集,卖给机器人公司去做训练,据说京东的家政员工都是带着摄像头和传感器去上门给人打扫卫生的;

    12、就是「镇馆之宝」的名头有点不够用了,光是我见到和听到的,就有不低于20家厂商在这么包装自家的展品,应该来个证书配套的;

    13、「AI六小虎」里来了五个,除了智谱以外——不知道是不是专心搞市值管理去了——都悉数到场,起码从观感上讲,它们已经活成了完全不同的样子;

    14、Minimax主打德智体美劳全面发展,一边服务于高价值的Coding市场,另一边在全模态创作上不断点亮技能树,整个展台散发着一种既硬核又带点人文的拧巴;

    15、零一万物是其中唯一一个老板亲自坐在展区营业的,开复老师的勤奋程度还是一如既往,但狂也是真的狂,一直在说不存在「六小虎」,现在的格局是「五虎一豹」,自家就是那头金钱豹;

    16、阶跃的体验是这几家里最好的,审美和产品全部在线,不光有让机器人搭巨型乐高的大活,AI手机也是人流量最大的展台之一,我很想试试,但真的挤不进去啊;

    17、反倒是我很期待的Kimi,显得格外松弛,展区很小,大概人手都分出去发新模型了吧,只有一个简单的发笔记送赠品活动,不过门口也是最挤的,全是想蹭K3热度的媒体,事实证明模型强就是可以为所欲为啊;

    18、和预想的一样,ChatBot已经退版本了,现在谁家不掏出几个Agent是完全上不了桌的,从传统互联网公司到AI Native的新势力,能看得出每家公司都在极力的画靶找靶,证明AI的生产力价值;

    19、比如腾讯的展区基本上可以说是Agent全家桶,WorkBuddy、Qclaw、Marvis等等能塞多少就塞多少,用产品能力的长处去弥补模型能力的短板,这是很擅长的;

    20、微信也来了,但和不来也没什么差别,没有上新大家真正关心的AI能力,而是很命题作文的搞了一个AI生成表情包并打印出来的交互屏幕,一种过年时小孩被爸妈强迫给亲戚表演个节目的应付感;

    21、阿里不出意外的还是在表现全栈式肌肉,芯片-模型-硬件层层递进,这次新亮相的有一个造型特别奇怪的AI耳机,放在玻璃罩里不让碰不让摸,功能也没怎么讲解,大概是学到了「过于先进,不便展示」的精髓;

    22、字节又没来——指的是设立独立展区——它对WAIC的态度一直比较疏离,好像从来没做过参展商,不过因为努比亚带着同样「只能看,不给用」的2代豆包手机成了全场最靓的仔,字节的存在感其实一点也不弱;

    23、不过最出圈的所谓字节系产品还是「豆脚」,你们应该刷到过了,就是有人拿豆包的Logo形象做了面罩,套在半身机器人上到处溜达,然后就有了「豆脚」的外号,十年打铁无人问,一朝整活天下知;

    24、百度就比较难绷了,还在年复一年的搁那炒作DAA(日活智能体数)的概念,不知道什么时候这家公司才能意识到,李彦宏拍脑袋想点什么大家就都得虎躯一震的时代早就过去了啊;

    25、今年来的学术界嘉宾阵容很扎实,什么9个图灵奖得主齐聚之类,但从演讲内容来看,普遍比较端水,没有特别突出的记忆点;

    26、朱松纯教授的演讲可能算是一个例外,属于你们都很懂的那种宏大叙事,直指AGI就是美帝下的套,「美国发明一个信息,我们再请美国人来讲一遍,形成信息的倒灌效果」,要知道在他之前演讲的就是美国来的「强化学习之父」Richard Sutton,哈哈,太不给面子了;

    27、「Token经济」成为行业共识基本没有悬念了,稍微隐晦的,还愿意标榜自己所谓的基座和工厂定位,一些演都不演的中转商,直接把财神当作了自家吉祥物,打出简单直接的标语:「下个风口,就是卖Token」;

    28、狂热和躁动的分布并不均匀,OPC(一人公司)的主题展区冷清得有点过头,这可是跟当初说好的不一样啊,难道说这么快就要承认现实了吗——AI并不能轻易替代公司这种经过了岁月考验的商业组织;

    29、理想是我见到的,唯一以整车品牌参展的新势力车企,还把马赫100芯片的对外亮相选在了这里,其他的要么没来,要么以产品合作的身份出现在展会上,比如阶跃和极氪;

    30、今年特斯拉也没来,有点反常,因为作为上海本地企业——嘘,别质疑——特斯拉历来都是WAIC的常客,加上具身智能这么热闹,马斯克反而避战了,不知道是不是操心SpaceX的破发去了;

    31、直到下暴雨之前,盛夏的天气实在是热浪逼人,现场每隔几步就会放一个巨大的冰块用来降温,即便如此,在人流量大的区域,不少人还是忍不住闷热,选择中途跑路;

    32、除了参展企业和从业者之外,更多普通人来这里其实是出于FOMO情绪,我经常会听到的对话是「有人给你报销差旅吗?」「没有,我自己要来的」「那你是纯热爱啊?」「再不来就真落后了」;

    33、更绝的是,我还看到有人拿着自己的简历现场求职,这个思路虽然清奇,但仔细想想还真挺精准的,但从科技公司的密度来讲,WAIC可比招聘会要高得多;

    34、还有一个不知道能不能说的男凝视角,就是漂亮妹妹明显比前几年多了,甚至还有宛若桃花的Coser随机出没,感觉有些吃到了BW的尾气,随便分流一点过来都是降维打击,我懂OpenAI为什么要在ICML请女团来跳K-Pop了;

    35、纯粹个人体感,AI眼镜的热度似乎有点下去了,各家拿来亮相的产品高度趋同,也没有特别让人眼前一亮的特点,干着干着就都干成工业级场景了,用来巡检、上课、看展等等,明显是在瞄准B端订单;

    36、银行之类的金融公司还在展示AI客服的降本增效,主打一个跟真实世界完全脱节的状态,不知道「天下苦没有活人客服久矣」的民情;

    37、中国移动算是参展运营商的代表了,明牌要把Token当成以前的流量计价销售,接了300多个模型,要卖给其他企业,相当于一个体制内可信中转站的角色;

    38、电算协同是比较让人心安的产业,几大电网都把能源供给的压箱底方案带来了,至少3-5年内,电是不可能缺的,缺的只会是把电能拉满的AI消费场景;

    39、因为最近这段时间恶劣气候影响频繁,气象局的自有模型「妈祖」得到了应该超出预期的关注,把它打造成公共产品服务国际社会也是很大气的构想;

    40、在西岸,荣耀的Robot Phone人气很高,别人都在整AI手机,它很机智的做了一台具身智能手机,手机自带一个可观测环境的机器臂,有点笨笨的中间形态味道,但确实吸引眼球;

    41、阶级分化是另一个很有意思的观感,就像低价小吃店总被满满当当的塞进商场里的B1层,世博主馆的地下就留给了预算有限的各种初创公司,其中很多连展台都没布置,支了一张桌子就算参展了;

    42、有家叫叽里呱呱的杭州公司摆出了金色蟾蜍造型的AI硬件,硬整出一条「打印桌宠」的赛道,蟾蜍嘴里会吐出打印出来的实体字条,很有仪式感,不过造型设计太丑是个劝退点;

    43、很多人喜欢B1层就是因为这里人味十足,不像上面那些展区普遍是热蔫儿了的打工牛马在接待同样热蔫儿了的出差牛马,B1层的小公司生命力一个比一个旺盛,人均想要刮中一张VC彩票,据说连曲曲都来了,不过我没见到;

    44、转了一圈,如果不看价格,我最想下单的是自动吹风机,可以解放双手,让一根机器臂帮你360度无死角的吹干头发,抽象归抽象,但真的很实用好吗,产品名字也很直率,就叫「吹了么」;

    45、小红书和欧莱雅都在搞面向非专业程序员的Vibe Coding活动,属于文科生狂喜的那种,格子衬衫含量为零,很多小孩儿拿着一堆表情包做的PPT就上台开讲了,年轻真好啊;

    46、AI的造星运动还在持续,如果说大厂们的造星对象是研究员,那Build in Public的造星对象就是素人开发者,一些知名度比较高的博主,是真的会被人群层层围住合影的;

    47、知乎在WAIC世博主场馆外办了今年的Tech Club,未来三十年内都不会有人猜到为何要选择这么撞日子和撞位置,真不怕被虹吸啊;

    48、尤其是WAIC临近结束时,场外因素开始明显大过了场内氛围,Kimi、DeepSeek、Qwen的三连发,连带着中美AI竞赛的新赛季叙事,带来了更高的观赏性,兴奋点一下子就燃起来了;

    49、便利店的烤肠太难吃了;

    50、最后想说的是场外的组局也多得简直过剩,毕竟这可能是一年到头来从业者最为密集的一百多个小时了,投资人拉项目,媒体人吹牛逼,主理人录播客,出差人喝夜酒,如果你很久没感受到经济上行的美了,上周末的魔都,可以负责管饱管够;

    51、有没有泡沫这个问题其实已经不重要了,借用一句台词来讲就是——「泡沫破灭前,每一个泡沫都闪烁着耀眼的光环,正是在一个个耀眼的光环中,人类充分发挥了自己的想象,最终改变了整个世界」——孩子们,明年WAIC再见。
    58224
  • Max_means_best
    13天前
    这两张照片是2024年月之暗面邀请我去北京他们办公室时我随手拍的。

    当时他们内部邀请了一些朋友去参观他们当时最新的 K0-Math模型。

    非常意外的是,那天是杨植麟亲自来给我们分享。

    当时杨植麟站在会议室里,没有讲产品,没有讲商业。

    他讲的是下一代 Scaling Law。

    PPT 上只有一句话:

    Next-Token Prediction Reinforcement Learning Scaling

    放在2024年,这更像一种判断。

    放在2026年,它已经变成了整个行业。

    OpenAI、DeepSeek、Anthropic、Kimi,几乎所有前沿模型,都走到了这条路上。

    很多人觉得Kimi K3突然变强了。

    我倒觉得,它只是兑现了一家公司两年前就做出的技术判断。

    还有一个细节。

    他不像很多创业者,更不像一个独角兽公司的 CEO,反而特别像个还在实验室里的PhD。

    聊商业、聊融资、聊市场,他都很平静。

    但一聊到架构、训练方法、数据细节,整个人一下子就兴奋起来了,眼睛都是亮的,能一直不停地讲。

    后来我们去他们办公室转了一圈,我特意看了一眼他的工位。

    没有独立办公室,没有估值百亿美金AI 独角兽CEO的痕迹,就是一个特别普通的位置,和周围的人没什么区别,桌上放着一些日常用品,但也不多。

    那个画面我记到现在。

    昨天Kimi发布了K3,轰动了整个海外AI界都,我认识的大部分朋友都在讨论K3具体的参数、架构、榜单。

    但我第一反应想到的还是那天坐在会议室里,那个技术讲到停不下来的那个“PhD”。

    我始终认为,一家公司最后做出来的东西,往往都会带着创始人的性格。

    有些公司擅长讲故事,有些公司擅长做增长,有些公司擅长包装产品。

    Kimi有时候会慢,有时候会让外界看不懂,但它一直在啃真正难的技术问题。

    从长上下文、数学推理,到今天Kimi在长程任务和Agent上的进展,这条线其实一直没有变过。

    很多公司是在追下一波浪潮。

    杨植麟更像是很早就选了一条路,然后一直往下挖。

    真正厉害的创始人,不是天天预测未来。

    而是很多年以后,你发现他一直在建设那个未来。

    这个时代每天有很多公司发布模型。

    只有少数公司,是在兑现两年前写在PPT上的路线图。

    真正的领先,从来不是 Benchmark 第一。

    而是两年前没人相信的时候,你就在往那个方向烧钱了。

    K3今天取得的伟大成就并不是突然发生的。

    两年前,答案其实已经写在那张PPT上了。

    祝贺Moonshot ,祝贺杨植麟🎉
    84
  • AGENT橘
    13天前
    微信终于支持打开 markdown 文件了
    虽然支持的方式非常非常诡异...
    00:07
    68
  • 科技编辑
    2天前
    今晚,月之暗面宣布开源 Kimi K3,并同步放出了模型权重和技术报告。

    Kimi K3 是目前月之暗面能力最强的模型,采用 2.8T MoE 架构,支持原生视觉理解,拥有 100 万 Token 上下文窗口。官方介绍,新架构让模型在相同算力下,智能水平提升了 2.5 倍。

    除了模型本身,这次还把背后的技术栈一起开源,包括高性能 Attention Kernel、MoE 通信库,以及支撑大规模 Agent 运行的基础设施。

    相比单独开源一个模型,这种做法的价值在于,开发者可以直接复用训练和推理过程中最核心的基础组件,自己训练、部署和优化大模型的门槛会继续下降。

    Model weights: huggingface.co
    Tech report: github.com
    Tech blog: www.kimi.com

    cr. Kimi.ai
    00
  • 人生复利星球-小胖
    11:15
    deepseek V4 或将推迟到八月中旬
    梁圣到底啥时候把多模态端上来
    62