即刻App年轻人的同好社区
下载
App内打开
FOX_AI
29关注172被关注0夸夸
base上海
ex互联网大厂 现AI创业者
分享一手AI实践经验 欢迎同行交流
FOX_AI
21天前
不知道大家最近有没有听过一个概念,叫人才债。

这个词是前微软业务部门总裁、前盖茨基金会CEO Jeff Raikes Fortune 上提出来的。

他说,现在很多公司都把初级岗位的活儿交给AI干,觉得这是降本增效,但其实是在悄悄欠下一笔看不见的债。

初级岗位确实简单,但它存在的意义不只是完成那些简单的任务。

它更核心的功能,是让新人通过干这些活儿来积累判断力。

而人才债,就是一个比技术债更可怕的东西。

1
比如一个投行分析师,入行头两年的工作就是做模型、拉数据、写备忘录。

这些事AI现在都能做,所以公司一拍脑袋,砍了初级分析师的编制,让AI顶上。

短期看,确实成本降了,效率高了。

但三年后,等需要一个能带项目、在关键时刻做判断的人,发现这样的人没有了。因为那些判断力,就是在头两年反复做那些看起来枯燥的基础工作里磨出来的。

初级岗位在某种程度上,就是公司的人才孵化器。你觉得自己只是砍掉了一个低薪岗位,实际上砍掉的是五年后的中层管理者和十年后的高管候选人。

这就是人才债,跟技术债一个道理,虽然现在看着省事,但以后会连本带利地还。

2
这当然不是 Raikes 一个人的直觉。

最近,微软发布了 2026 工作趋势报告,调查了十个国家的两万名劳动者。报告里提到,在AI时代最值钱的人类技能,是批判性思维和对AI输出结果的判断力。

能在指挥AI和自己动手之间灵活切换的人,微软给起了个名字叫「前沿专业人士」,而这类人在所有劳动者中只占16%。

而且,这16%的人有一个共同习惯:他们会故意挑一些任务不用AI来做,就是为了保持自己的思考能力不退化。

Gartner 那边的预测也是,到2026年底,全球一半的组织会开始要求员工通过「无AI技能评估」。

意思就是,你不能只会指挥AI干活,你得证明拔掉这个拐杖你自己也能走路。

3
很多人会觉得这是管理层才需要操心的事,但其实不然。

Raikes 在文章里引用了一个教育创新者 Paul LeBlanc 的观点。

LeBlanc 是美国最大非营利大学南新罕布什尔大学的缔造者,他在新书里说了一句话:未来教育的核心不是教人跟上机器,而是利用机器让人变得更像人。

也就是说,要把AI当工具来释放时间和注意力,让学生能在真正需要人去做的事情上扎得更深,比如建立关系、协作、面对伦理困境时做取舍。

效率不能是唯一的目标。你可以用AI让学习更快、更便宜,但如果因此跳过了锻炼判断力的环节,那这个效率最终是自欺欺人。

前段时间,摩根士丹利发了一份关于AI生产力的研究,被 Fortune 报道了。

数据显示,在AI渗透率高的行业,单位工人的产出大幅上升,但就业水平基本没变。

看起来是工人被增强了,并非被替代了。

Raikes 指出了这个数据没回答的问题:产出提升最大的那批人,恰恰是本身就知道怎么指挥AI的人。

他们的判断力和专业底子不是AI给的,是之前的教育和工作经验给的。

4
那么接下来的问题就是,谁在负责培养下一批这样的人?

现在大部分项目教的还是AI操作能力层面的东西,学会怎么写提示词、怎么用工具做分析。

但问题是,光有这些不够。培养深层判断力的课程更难量化效果、更难拿到经费,所以在资源竞争中总是输给那些容易出成绩单的技能培训。

这跟企业的逻辑是一样的,能量化的先砍、先省、先优化,不能量化的就往后排。

AI素养如果没有批判性思维做底,不是什么人才战略,充其量是一个短期止疼药,而且迟早要加倍还。

很多人现在觉得学会用AI就高枕无忧了,但真正的护城河从来不是工具本身,而是你离开工具以后还剩下的那些东西。

能看出AI输出中的问题,在模糊地带做出合理取舍,把不同来源的信息整合成一个有说服力的判断,会是越来越稀缺的能力。
00
FOX_AI
24天前
这两天有个朋友找我帮忙,说想给他们团队做一条产品介绍短片,预算基本为零。

我说你去找剪映套个模板呗。

他说不行,想要那种代码生成的动态效果,看着高级但又不想花钱请动效设计师。

我正好最近刚下载了MCode一直没怎么深度用,听说它的多模态能力挺强,代码能直接搓视频。

正好拿这个当实验,试试看到底能交付到什么程度。

我直接在电脑上给MCode下了任务,让它帮我做一个代码搓视频的skill,这次我用了它刚上的Goal模式,没有一句句喂指令,而是把整个任务设成一个目标丢给它,让它自己拆解着干。

我突然想起来,MCode最近上了远程控制。我掏出手机连上了桌面端的Agent,锁屏出门买咖啡了。

在电梯里我瞄了一眼手机,它跟我确认了一下skill的注意事项,有几个环节需要我点头,我直接在手机上回复就行。
以前用AI工具,不管多智能,你都得坐在电脑前盯着。

MCode的远程控制把这件事改变了:你在手机上能看到Agent的实时进度,能发指令让它调整方向,遇到需要权限审批的步骤也能直接在手机上处理。

再配上Goal模式,目标定好它自己往前推,需要我拍板的时候才来找我。

等我回到电脑前,短片已经做好了。

出来的效果比我预期的好。不是那种PPT配转场的糙活,是真的用代码渲染出了动态图形,有节奏感,有层次,配上MiniMax的语音合成做旁白,一条完整的短片框架就有了。

当然细节上还需要打磨,有些转场的时间点对不太准,个别画面元素的位置需要手动调。

但作为一个零成本、一个人搞定的起点,这个完成度已经能交差了。

朋友看完说可以,改改就能用。

这件事给了我一个好奇心:如果MCode在这种多模态交付上表现还不错,那它在纯前端Coding上能到什么水平?
毕竟它内置了一个叫front-design-master的skill,专门针对前端设计优化。

另外有一个让我做前端测试特别舒服的点,MCode有内置浏览器,生成的页面直接在侧边栏就能看,不用切出去开Chrome。最新版还加了浏览器操控,Agent能在内置浏览器里自动读取页面内容、填表单、上传文件,干完还会自己检查一遍结果,挺省心的。

于是我又设计了三个case,看看它在一次提示词、零手动修改的条件下,能交出什么样的东西。

1、赛博朋克个人作品集

我给了一段非常详细的提示词,要求做一个电影感的个人作品集网站,主题叫「城市夜行」,设计风格参考银翼杀手2049的色调,霓虹橙加深海蓝加雨夜灰,整体是赛博朋克混合东方美学的氛围。

结果比我预期要好很多!

页面打开的第一秒,背景有隐约的霓虹光晕在闪烁。作品画廊的横向滚动和hover的3D倾斜效果都跑通了,自定义光标带拖尾也做了。

一次生成,直接在MCode内置浏览器里就能看效果,不用切来切去,视觉完成度已经超出我对AI写前端的一般预期。

拿去做作品集或者给客户demo,稍微调一调细节就能用。

2、3D户型漫游

第2个case,测3D建模和空间渲染。

我要求做一个80平米两室一厅的3D漫游:墙体200mm厚度,门窗精确开口,天花板2.8米高。
不同房间不同地板材质,客厅橡木、厨房灰瓷砖、卧室米色地毯。
家具从L型沙发到洗碗机逐一摆放。
光照根据朝向区分,南向明亮北向柔和。交互上要求第一人称WASD移动,碰撞检测不能穿墙穿家具,点击家具弹信息卡。

另外加了三套风格切换:北欧、日式、工业。

这个case和前面完全不是一个量级。

3D空间涉及几何建模、材质贴图、光照计算、物理碰撞、相机控制,每一项都不简单,更别说放在一个单文件HTML里跑。

它确实生成了一个能走进去看的3D空间。Three.js搭的,基本房间布局有了,WASD在里面走动,鼠标控制视角,墙体有厚度,门窗有开口。

但细看问题也有,家具建模比较粗糙,材质差异做了,但质感就是不同颜色的平面。光照的南北朝向明暗差异不太明显,软阴影效果有限。

碰撞检测倒是比较有意思,你撞到墙壁和家具确实会被挡住,不会穿过去。但有些角落的碰撞体积不精确,偶尔被家具边缘卡住。

点击家具弹信息也实现了,弹窗样式简陋但功能在。

风格切换这块,切换按钮有了,点击后色调确实变化。
但三种风格的差异主要在配色上,家具形态和材质纹理没跟着换,感觉更像换了个颜色滤镜。

不过,在单文件HTML、一次生成、无外部依赖的前提下,跑出一个有碰撞检测的可漫游3D空间,能做出这种效果已经很惊艳了。

3、星际快递员:手搓3D游戏

最后,是一个3D独立游戏:玩家驾驶飞船在程序化生成的星系里运送包裹,每个星球有独特地形和重力,要躲太空海盗,在燃料耗尽前完成投递。

视觉风格参考星际拓荒,低多边形加强烈色彩对比。技术上Three.js加Cannon.js物理引擎,程序化地形用Perlin噪声,飞船WASD控制,空格加速消耗燃料,任务系统从接包裹到着陆投递到计分,音效Web Audio API生成。

这个case让一个前端开发者从零写,保守估计也得一到两周。

MCode跑出来的结果,它确实生成了一个能在浏览器里直接玩的3D游戏。

开场画面有太空背景,飞船在中央缓慢旋转,星空粒子飘动,点击开始后能看到几个不同颜色的低多边形星球漂浮在太空中。飞船WASD控制飞行,鼠标控制方向,空格加速,操作基本流畅。

任务系统框架搭起来了:界面显示目标星球方向指示,飞过去、靠近、完成投递。燃料随飞行消耗,HUD显示燃料条、积分和当前任务。

星球表面确实有高低起伏,靠近时能感觉到引力牵引。太空海盗也出现了,会朝你移动,但AI行为比较简单,基本直线追逐。

当然,飞船偶尔卡在星球表面出不来,着陆判定有时不灵敏,需要反复尝试才能触发投递。有一次飞出了场景边界,再也回不来了。

总之,在前端方向上,MCode的默认审美确实比很多工具好一截。

产品形态上也有让我有好感的地方。

另外值得提一句它的TokenPlan,49块的套餐有6亿多token,还包含了图片、语音、音乐、视频生成额度。

对比同价位的产品,这个性价比确实突出。

如果你是一个有想法但缺乏技术实现能力的人,MCode可能会让你觉得打开了一扇门。尤其是那些需要同时调动文字、图像、音频、视频的项目,它的多模态整合能力是目前同类产品里比较少见的,很推荐大家亲自上手试一下~
00
FOX_AI
27天前
来给大家分享个A I Coding的省钱小窍门,适合平时重度使用AI编程工具的朋友。

比如这个就是我最近用新上的Qwen3.8-Max-Preview把清明上河图做成的3D互动场景,只花了几毛钱。

因为我现在在创业,基本每天都在用AI写代码。但我发现自己养成了一个很奇怪的习惯:每次按回车之前,都会先在心里估算一下这轮对话要烧多少credits。

但最近,Qoder上线了Qwen3.8-Max-Preview的折扣活动,日间一折,夜间低到零点二折。

我算了一下,零点二折意味着只花原来2%的钱,所以我立刻把之前攒下来的那些想做但舍不得跑的项目,全部丢给它。

1、清明上河图3D互动场景

需求是这样的,我想看看AI能不能把清明上河图虹桥附近的市井场景做成一个可探索的3D微缩世界,包括拱桥、河道、货船、摊贩、茶馆、挑担行人、牲畜、两岸店铺。

核心交互是一个原画里真实存在的情节——一艘桅杆没放下的货船正在靠近虹桥,玩家需要点击船员、绳索和桅杆来帮船安全通过。还要有自由漫游、画卷式横向镜头、昼夜切换和热点知识介绍。

它不光考验代码生成能力,还考验模型对中国传统绘画内容的理解,比如虹桥是什么形制、宋代摊贩长什么样、货船的桅杆结构是怎样的。

Qwen3.8-Max-Preview的完成度非常高。

拱桥的造型是对的,半圆拱、木结构,没有做成石拱桥。低多边形的摊贩和行人虽然谈不上精致,但能看出宋代服饰的大致轮廓。货船通过桥洞的交互逻辑也跑通了,点击顺序和反馈都合理。

昼夜切换的光照变化做得不错,白天的市井热闹感和夜晚的灯笼暖光形成了很好的对比。

画卷式横向镜头是我最喜欢的部分,从左往右慢慢推过去,确实有一种展开长卷的感觉。

2、低多边形3D平台跳跃游戏

我让AI用Three.js写一个完整的3D平台跳跃游戏,不用任何外部素材,纯程序化生成。玩家控制一个戴护目镜的圆滚滚机器人,在漂浮岛屿上跳跃、冲刺、收集能量核心,集齐十个之后开启传送门通关。

Qwen3.8-Max-Preview给出了一个完整可运行的HTML文件,打开就能玩。

机器人的低多边形建模比我预期的要好看,漂浮岛屿的程序化生成也没出现那种拼接痕迹明显的问题。镜头跟随、碰撞检测、二段跳的手感调校。

当然,个别平台之间的距离偶尔会让人觉得跳不过去,弹跳板的力度反馈也还可以更细腻。但作为一次对话跑出来的结果,比我对AI coding的预期高了不少。

关键是,整个过程我没有因为credits焦虑而做任何妥协。该给的需求全给了,模型也全接住了。

3、上海陆家嘴3D白模场景

我要求用Three.js搭建上海陆家嘴核心区的3D白模,覆盖东方明珠、上海中心、环球金融中心、金茂大厦、滨江步道和黄浦江局部。几座地标建筑要用程序化低多边形模型单独搭建,重点保证高度关系和轮廓辨识度。整体要做成那种建筑竞赛的白模风格——建筑白、道路灰、水面浅蓝。

这个项目对模型的空间理解力要求很高。上海中心632米、环球金融中心492米、金茂大厦420米、东方明珠468米,这几座楼的高度比例关系如果错了,整个场景一眼就穿帮。

Qwen3.8-Max-Preview在这方面的表现让我比较满意。
四座地标的相对高度关系基本准确,上海中心最高、环球金融中心次之,这个没搞混。

东方明珠的三球结构和支撑柱也做了出来,辨识度很高。四个预设镜头——浦西远眺、黄浦江上空、陆家嘴环岛、建筑群顶部——切换起来确实能感受到不同视角下城市天际线的层次。

白模风格本身就要求克制,所以低多边形在这里反而是优势,整体干净利落。点击建筑弹出名称和高度信息的交互也正常工作。

如果是做建筑方案的前期概念展示,或者城市规划的快速可视化,完全可以用。

4、关于cost

测完之后,我去看了用量明细。因为现在Qoder推出了Qwen3.8-Max-Preview的折扣活动,白天时段,也就是北京时间早8点到晚10点,这个模型打1折。

到了夜间错峰时段,晚10点到第二天早8点,直接0.2折。
但便宜不是重点,重点是这个Qwen3.8-Max-Preview模型确实能打。而且更新到最新版就自动生效,不用额外操作。

小红书上有个 #Qoder省钱攻略 的话题,里面有不少人在分享自己的用法和省credits技巧,感兴趣可以去翻翻。

折扣是有时间窗口的。特别是夜间0.2折这个力度,我不确定能持续多久。如果你平时有在用AI编程工具,建议尽早体验一下,感受会比较直观。
00
FOX_AI
29天前
最近刷到有人在闲鱼上卖 Codex 皮肤赚了不少钱,感觉真的太离谱了。。。
比如易烊千玺同款 Codex 皮肤、张凌赫同款工作台、迪丽热巴风格 AI 编程桌面,一套图卖十几块到几十块不等。

我刚开始还以为是什么很复杂的定制插件,结果顺着看了一圈,发现核心很简单😂

就是给 Codex 桌面端换一张好看的背景,再让原本的输入框、侧边栏、项目卡片都浮在上面。
而且,这件事自己就能做,不用花钱买,我今天就跟大家分享3分钟上手教程,非常简单。
用到的开源项目叫 Codex Dream Skin,已经11k🌟了。

1
这个skill能做什么?
简单说,就是给 Codex换皮肤,帮你把Codex 的首页和工作界面换成你喜欢的视觉风格。
比如你可以做一个易烊千玺同款风格。

或者做一个迪丽热巴同款风格:高饱和、时尚大片、粉紫氛围。

换完以后,Codex 原本的输入框、侧栏、建议卡片都还在,不会变成一张不能操作的假截图。你还是正常用 Codex,只是整个工作台变得更有氛围。

2
怎么安装?
普通用户不用 clone 仓库,直接打开这个项目的 GitHub Releases 页面,下载对应系统的安装包就行。

下载前有个小步骤:先打开一次官方Codex桌面端,然后退出。这样它会先把本机配置文件创建好,后面换肤工具才能正常工作。
Mac 安装就是打开 DMG,把 App 拖进 Applications。

第一次打开如果提示“无法验证开发者”,不要去关系统安全设置。

直接去:系统设置 隐私与安全性 仍要打开

Windows 如果弹出 SmartScreen,点“更多信息”,确认文件是从 GitHub Releases 下载的,再点“仍要运行”。

3
安装完怎么换成爱豆同款?
Mac 会在右上角菜单栏出现 Dream Skin 图标,Windows 会在系统托盘出现图标。
点开以后,找“换一张背景图”。

然后你准备一张 16:9 的纯背景图,最好是 2560 × 1440 这种横版图。可以是你自己生成的,也可以是你自己有权使用的图片。
重点来了!
不要直接拿带 Codex 界面的截图去导入。你需要的是“干净背景图”,也就是只有人物、光影、场景,没有输入框、按钮、文字 UI。
比如你想做易烊千玺同款,就让 AI 生成一张“黑红舞台光影、电影海报感、16:9、无文字、无界面”的图。
想做迪丽热巴同款,就生成“时尚大片、粉紫灯光、精致妆造氛围、16:9、无文字、无界面”。
导入之后,Dream Skin 会自动把它适配到 Codex 里。你觉得好看,就保存成一个主题,以后可以一键切换。

4
如果你也想试试,流程就三步:
GitHub 下载 Codex Dream Skin
准备一张 16:9 的爱豆风格背景图
从菜单栏或托盘导入并保存主题
不用去闲鱼买,也不用改 Codex 文件。
花几分钟试一下,你就能拥有自己的“爱豆同款 Codex 工作台”。
00
FOX_AI
3月前
最近用 Codex 写项目,发现了一个问题,就是上下文的管理。

但我最近发现了一个很好用的项目,叫 ok-skills,它是一套专门为 Claude Code、Codex、Cursor 这类 AI 编程工具整理的可复用 skill 集合,有 40 多个。

可以告诉 AI 在特定场景下应该怎么工作,做什么,不做什么。

1
先说我用得最多的一个:planning-with-files。
它解决的问题很具体:AI 在复杂任务里没有持久记忆。

这个 skill 的思路来自 Manus 的工作方式——把"上下文"从对话窗口移到文件系统。
它让 AI 在开始任务之前先创建三个文件:task_plan.md 记录阶段目标和决策,findings.md 存放调研发现,progress.md 做每次操作的流水记录。

整个任务过程中,AI 每隔两个操作就写一次文件,保证关键信息落到磁盘上,而不是飘在对话上下文里。

我实际用起来的感受是,任务被强制结构化了。
AI 不能一上来就开始写代码,必须先建计划,先搞清楚做什么、分几步、每步验证什么。遇到报错也要记下来,下次不许重复同样的失败方式。
正是因为有这些约束,长任务才不容易跑偏。

2
另一个让我觉得挺有意思的是 grill-me。
它做的事情是,在你真正动手之前,逼着你把方案想清楚。

具体方式是一问一答的审讯式对话。
AI 会对你的方案提问,一次只问一个问题,问完你的回答再继续问下一个,直到设计上的每一个决策都有明确答案为止,不允许你含糊过去。

我第一次用它的时候觉得有点烦,因为它揪住了几个我自以为想清楚了但其实根本没想清楚的地方。
但事后复盘,那几个被追问出来的问题,确实是后来真正出问题的地方。

与它配套的还有一个 grill-with-docs,专门对照文档、架构决策记录(ADR)来质疑你的方案,边问边帮你把结论更新到文档里,对需要维护长期项目文档的场景很有用。

3
还有几个平时用得到但容易被忽略的:
find-docs 是查文档的。AI 写代码经常会用到一些过时的 API,因为它的训练数据有截止日期。
这个 skill 接入了 Context7,能在写代码之前先拉取当前版本的库文档,减少写出来能跑但已经是旧写法的情况。

gh-fix-ci 是修 CI 的。
GitHub Actions 挂了,日志拉下来,让 AI 读、归因、出方案,一套流程走完。不用自己一行行去看那些 ANSI 颜色乱码的日志。

frontend-design 和一整套叫 impeccable 的设计 skill 包是做界面的。
这套东西有个专门的概念叫"AI slop test"——如果你把这个界面给人看,对方一眼就觉得是 AI 生成的,那就是问题。

skill 里整理了一份很详细的"AI 生成界面的典型指纹":蓝紫色渐变、毛玻璃卡片、每个 heading 旁边放图标……
skill 的作用是给 AI 立规矩:什么不能用,往哪个方向走。

4
使用方式不复杂。
把仓库 clone ~/.agents/skills/ok-skills,然后在你的 AGENTS.md 或者 CLAUDE.md 里加几行触发规则,告诉 AI 什么时候用哪个 skill。

比如任务超过 5 个工具调用就启用 planning-with-files,需要查文档就用 find-docs,要做界面就读 frontend-design。
之后直接自然语言说"用 planning-with-files 来规划这个重构"就可以了。

仓库里的 skill 来源很杂,有 Anthropic 自己出的,有 OpenAI、Vercel、Upstash、各路开发者贡献的,ok-skills 这个仓库做的事情是把它们收集整理到一起,让你不用到处找。

这个ok-skills 是目前我见过整理得比较完整的一套。
686
FOX_AI
3月前
我最近刷到,MiniMax解决了一个“马嘉祺”bug😂

MiniMax团队最近发了一篇技术博客,讲他们怎么排查一个时代少年团粉丝反馈的问题。
有粉丝发现,问模型“马嘉祺”是谁,它虽然能完整回答,出道经历、所在团体、代表作。

但只要你追问他叫什么名字,模型就会已读乱回,就是喊不出马嘉祺的名字。

我看到这个问题的时候,第一个猜测是:是不是训练数据里这个名字出现太少了,模型压根没学到。
但实际答案比这有趣得多。

1
是不是模型根本不认识这个名字呢?
这在逻辑上说不通,因为模型能介绍这个人,说明它知道这个人。问题不是知识缺失,是别的地方出了问题。

比如,我们有时候也会出现,想说某个人的名字,但就在嘴边,说不出来。
大模型也会有类似的问题。
模型内部有两个关键模块:
一个叫embedding,负责把文字转成模型能计算的向量,可以理解为理解层;
另一个叫lm_head,负责把向量转回文字输出,是生成层。
这两套参数是独立的,各管各的。
MiniMax团队检查了预训练之后嘉祺这个词的理解层状态,向量正常,最近邻全是相关人名,亚轩、千玺、肖战……理解层完全没问题。

但问题出在生成层。
模型知道嘉祺是谁,但生成层找不到它了。

2
那么,生成层出了什么问题呢?
知道是生成层的问题之后,我以为还是数据太少。后训练数据里嘉祺这个词出现频率太低,所以生成层没学好。
这个猜测只对了一半。
MiniMax统计了一下,后训练数据里包含嘉祺的样本不足5条。

频率低确实是起点,但真正造成问题的机制是这样的:一个词几乎不出现在训练目标里,它的生成层参数就几乎收不到正向的梯度更新。
但与此同时,有一种叫weight decay的正则化机制还在持续施压,让不活跃的参数慢慢往零的方向漂。
这个漂移过程是无声的。不报错,不影响模型整体表现,标准评测也发现不了。
漂移到什么程度?
检查生成层之后,嘉祺这个词的近邻已经变成了file_content、edit_file这类工具调用标记。
一个人名,跑到了代码工具的语义空间里。

3
知道根因之后,MiniMax顺手扫了整个词表,看看还有哪些词退化了,然后发现了一件更让我意外的事。
退化最严重的不是某个明星的名字,而是日文口语token,占退化最大类别的40%以上。

这些词在预训练时学过,但后训练数据里几乎没有它们的位置。
但漂移带来的后果不只是说不出日语词。日文向量飘走之后,跑到了其他语言的向量旁边。

生成时错误激活,就出现了跨语言干扰。
这就和另一个被诟病已久的问题对上了——日语对话偶尔会混入俄文,一直没找到根因。
数据非常直接:修复前,日语对话里俄文字符的出现率是47%,29.7%的日语token跌破了向量相似度的健康阈值。
两个看起来完全无关的问题,同一个根因,一条线索解了两道题。
而这种问题在常规评测里几乎发现不了,只有在真实使用里才会以各种奇怪的方式冒出来。

4
那如何修复呢?
MiniMax的实际方案是:把全词表20万个token随机分组,每组大约8000个,打乱顺序构造成一条对话,query是这堆词加一句请重复以上内容,answer就是原样复制。
总共500条数据,确保每个token至少作为生成目标出现20次。
结果出乎意料地好。日语对话俄文混入率从47%降到1%,马嘉祺正常输出,全词表向量相似度维持在0.97以上。
500条数据修好了20万词表。
当然,这只是目前跑通的一条路,MiniMax在博客里也提到,他们还在探索其他方向。
一个思路是在后训练数据里按比例混入预训练语料。预训练数据的词表覆盖天然比后训练数据宽得多,混进来相当于给那些冷门token补了一条保险。
另一个思路是专门统计哪些token在后训练数据里覆盖不足,然后针对性地造包含这些token的高质量对话样本。相比全词表覆盖的方案,这种方式数据量更小,语义质量也更高,代价是需要维护一套持续监控token覆盖度的机制,不是一次性的工程。
还有一条路更激进,直接从词表层面下刀——把那些在目标场景下几乎永远不会用到的token裁掉,比如预训练特有的格式标记、传奇私服这类SEO垃圾词,然后对裁剪后的词表做继续预训练,重新对齐整个向量空间。

5
说回这篇博客本身,我觉得最值得单独讲的不是技术方案,而是他们选择把这件事写出来这个动作。
大多数公司发现bug之后,会悄悄修掉。
但MiniMax这次,是直接把整个排查过程都写了出来,包括最开始错误的猜测,包括哪些问题还没完全解决,日语退化的完整数据。
这种问题如果不说出来,行业里每家做后训练的团队都有可能踩到,各自私下修,各自损失。把过程写出来,意味着让别人看到你走过的弯路,也意味着让整个行业少走一遍弯路。
时代少年团的粉丝大概没想到,测试爱豆这个动作,最后推动了一次行业层面的工程研究。
00
FOX_AI
3月前
经常要画架构图,但不知道怎么用AI生成的朋友们,推荐你去装一下这个Skill,叫 fireworks-tech-graph。

你说一句话,它就可以给你画一张生产级别的技术架构图,SVG 加高清 PNG,直接能用。

而且一行命令搞定安装,五分钟以内全部就位。

现在已经6k多star了!我装上去用了一周,说一下真实感受。

1

第一个场景,是给一篇内部文档配架构图。

比如,写一个关于 Mem0 记忆机制的技术说明,需要解释数据怎么流进来、经过 Memory Manager 之后怎么分别写进 Vector Store、Graph DB KV Store,检索的时候又怎么从三个地方读取合并、最后返回给上层应用。

这套逻辑如果自己画,光是想清楚节点布局就要花不少时间,更别说还要对齐、调样式、选字体。

可以直接跟它说:画一个 Mem0 记忆架构图,蓝图风格,包含这几个节点。

它对 AI Agent 领域的图表有真正的语义理解,知道什么节点用什么形状、什么关系用什么箭头,这些领域知识你不需要每次在 prompt 里重新解释。

2

还有另一个场景,是给技术分享做幻灯片配图。

内容是一个工具调用流程:LLM 收到请求,调用 Tool Selector,执行工具,Parser 处理结果,再返回给 LLM,整个是一个循环。

Style 2,深色终端风,黑底加霓虹色,等宽字体。告诉它流程节点,让它画。

3

当然,如果你本身对图形工具很熟练,用draw.io 做架构图完全不觉得费劲,这个工具能给你增加的价值就有限。

它更像是把画图这件事的门槛往下压了一截,让那些"因为太麻烦所以算了"的图,变得真的会去画。

很多技术文档写得不好,不是因为作者不懂,是因为配图太费事,最后文档里全是文字,读起来很累。

如果画图的成本降到跟写一句话差不多,配图这件事就会从"要不要做"变成"当然要做"。

有一类人可能最合适:独立开发者,或者在小团队里什么都要干的人。

既要写代码,又要写文档,还要做演示。这种情况下,能在需要的时候快速出一张像样的架构图,省的不只是时间。

当然,够不够用,还是推进你自己装一下试试。
03
FOX_AI
3月前
做产品经理的朋友们,推荐你们都去装一下这个skill,名字叫 lenny-skills。

这个skill,涵盖了86 个资深PM技能,都是从 Lenny's Podcast 的访谈里蒸馏出来。

Lenny's Podcast 如果你没听过,可以去搜一下,它是英文产品圈里最有影响力的播客之一。

这个项目,把 100 多期播客里的内容,整理成 86 Skill 文件,每个文件对应一个产品工作场景,然后放进 Claude Code .claude/skills/ 目录里。

我装上去试了一周,说一下我的真实感受。

1
我第一个用的是 writing-prds 这个技能。

我们团队在做一个新功能,大概方向清楚了。

装了 writing-prds 这个技能之后,我重新跟 Claude 对话,说我在做什么、目标用户是谁、想解决什么问题。

Claude 问我的第一个问题是:你现在写这份 PRD,最主要的读者是谁,他们读完之后需要做出什么决定?

我的 PRD 是写给工程师看的、还是给 stakeholder 看的、还是给自己理清思路用的,这三件事对应的写法其实完全不一样。

之后 Claude 给我的建议开始变得不一样了。

它不是在帮我填框架,而是在帮我想清楚一些更根本的东西:这个问题值得现在解决吗、我们真的理解用户痛点还是在假设、成功的标准是什么以及我们有没有能力衡量它。

2
还有competitive-analysis 这个技能。

当时我在研究一个竞品,想搞清楚我们跟它的差距在哪、对方的定位是什么、我们有没有机会。

competitive-analysis 技能之后,Claude 先问了我几个问题,有一个是:你现在做这个竞品分析,是要做出什么决定,还是要说服谁?

我当时随口说,是给团队做方向判断用的。

Claude 接下来说的一句话我印象很深:竞品分析最常见的错误,是把描述当成了分析。知道对方有什么功能是描述,但知道他们为什么这么做、这么做意味着什么、我们应该如何回应,才是分析。

然后它引导我沿着这个方向去想:竞品的用户是谁、他们选择竞品的真实原因是什么、对方在哪些地方有结构性优势而不只是暂时领先、我们能差异化的空间在哪里。

3
说实话,如果你是一个经验很丰富的 PM,在某些场景下你可能觉得这东西给出来的框架你早就知道。

但即便是这样,我觉得它的价值可能在另一个地方:帮你快速组织思路,帮你在对话里逼出一些你知道但没有认真想过的东西。

对于刚进入产品岗位不久的人,或者像我这样产品经验不是特别深、但经常需要做产品决策的人,它的价值会更直接。它不会让你跳过学习的过程,但它会在你需要的那个具体时刻,帮你用上一些你原本不知道的思考方式。

有一类人可能最适合:就是那些在小团队里、一个人当多个角色用的创业者或独立开发者。

既要做产品、又要写文案、又要想增长,什么都得懂一点但什么都不够深。这种情况下,能在需要的时候快速调用一个经过验证的框架,是很实用的事情。
18215
FOX_AI
5月前
最近看到Karpathy发了一条动态,说他现在大量的算力,已经不再是用来写代码,而是用来管理知识。
同时,他也在这条动态里,完整开源了他的知识管理方法。

我花了点时间认真研究了一下他的整套流程,并且在我自己电脑上也完整复刻了一下。

1
在开始之前,请先思考一个问题:你平时一般都是怎么处理信息的🤔

看到一篇好文章,直接收藏;朋友分享过来一个链接,转发给文件传输助手?
然后,这些东西就消失了......

你收进来的是信息,但信息本身不会自动变成知识。
中间差的那一步,是加工。

Karpathy的知识管理法,就是把这个加工过程,完整地设计出来。

2
他的做法其实不复杂。
你所有原始素材,文章、论文、代码仓库、图片,统统扔进一个叫 raw/ 的文件夹。
可以把这个文件夹理解为一个原材料仓库,什么都不用整理,直接堆进去。

然后他用大模型做了一件事:把这堆东西「编译」成一个wiki,也就是一个结构化的知识库。
在编译过程中,AI会提取核心概念,为每个概念单独写一篇文章,再把这些文章互相链接起来,形成一张网。

最后,他会用Obsidian作为可视化工具,查看这一切。
他几乎不会手动编辑知识库里的任何内容,所有的写作和维护,都是AI在做。

AI可以保持高度的一致性,同时处理大量文档,并且主动去找连接点。

3
知识库积累到一定规模之后,有趣的事情就开始发生了。

比如Karpathy某个研究方向的知识库,大概有100篇文章、40万词左右。
到了这个量级,他可以直接对着知识库问各种复杂问题,AI会去翻阅相关文档,综合不同来源的内容,给出完整的回答。

他原本以为需要搭一套复杂的RAG系统才能做到这件事,但实际上根本不需要。
AI在这个规模下,自己会维护索引和摘要,检索起来已经足够准确。

接下来,他不让AI的答案只存在于对话框里。
每次提问得到的输出,都会被重新归档回知识库。你的每一次探索,都沉淀成了永久的内容。

这个知识库是在生长的,而且它的生长方向,完全由你的好奇心决定。
你越用,它越有价值。

这跟我们日常用AI的方式有一个本质的区别:我们平时问完就忘了,下次遇到类似的问题,重新问。
但用这种方法,你的每一次问答都在给系统加砖。

4
Karpathy还会定期让AI对知识库做「健康检查」,找出哪些地方信息前后矛盾,哪些概念描述不完整,哪些潜在的连接还没有被发现。
这些问题找出来之后,补充、修正、新增文章,知识库的质量就在这个循环里持续提升。

我们自己的知识体系,有没有人在帮我们做这种检查?
大多数时候是没有的,我们脑子里有一堆知识,但哪些是准确的,哪些是模糊的,哪些其实是互相矛盾的,我们并不清楚,因为没有一套机制去把这些东西显化出来。

Karpathy这套流程,在某种程度上解决了这个问题。
至少在他的研究领域里,他对自己知识的掌握程度,是可以被系统性验证的。

5
不过说句实在的,他这套东西要完整复现,门槛确实有点高,需要对工具有一定的熟悉度,也需要持续投入时间去维护。

但这里面有一个思路,我觉得任何人都可以马上开始用。

你不需要搭一套完整的知识库系统,可以从一个最小的动作开始:下次读完一篇让你觉得有收获的文章,不要只是收藏,花三分钟让AI帮你提炼核心观点,然后问它一个问题:这个东西,和我之前知道的哪些东西有关联?

这一步的意义在于,它把"被动接收信息"变成了"主动建立连接"。

时间长了,你会发现自己对知识的感知方式开始变化,不再是"我收藏了很多东西",而是"这些东西在我的理解框架里处于什么位置"。
01
FOX_AI
5月前
今天刷小红书,看到我很喜欢的博主张咋啦分享她做的这个 follow-builders skill,立刻让我的龙虾去装了一下。

这个skill的核心理念源于zara之前说的:关注做产品的builder,而不是kol。

安装过程很简单,直接把这个skill复制给你的龙虾,然后让它安装。

安装好以后,会有一个简单的onboarding流程,你可以根据你的个人偏好回答一下。

我用上这个skill以后,都不需要自己去刷各种信息源站了!

现在 AI 圈子里信息太多了,很多都是故意制造焦虑的信息。真正有价值的,其实是那些在一线做产品的人的原创思考。比如 Karpathy 对模型训练的见解,Kevin Weil 对产品设计的思考,Amanda Askell AI 安全的观点,这些才是真正值得花时间消化的内容。

follow-builders 这个skill做的事情,就是帮你把这些人的最新动态和播客内容,自动整理成一份精炼的摘要,每天或每周定时推送给你。

它追踪的内容源是精心筛选过的。包括 Latent Space、No Priors 这些顶级 AI 播客,还有 25 位真正在做事的建设者的 Twitter 账号。

这个名单是集中维护的,会自动更新,你完全不用操心。

我之前也试过用 RSS 订阅或者 Twitter 列表来管理信息,但问题是信息量还是太大了。

一个两小时的播客,你可能没时间完整听完。一个建设者一天发十几条推文,你也不知道哪条最重要。

follow-builders 会帮你把播客总结成关键要点,把推文筛选出最有价值的部分,配上原文链接。

你可以快速扫一遍摘要,对感兴趣的内容再去看原文。这样一来,半小时就能掌握这些顶级建设者一周的思考精华。

我现在的习惯是,每天早上直接看一遍我的虾给我整理的摘要,标记几个想深入了解的话题,晚上再去看原文或者听完整的播客。

信息焦虑没有了,反而对行业动态的把握更清晰了。

而且如果你想调整摘要的风格,也可以随时跟 agent 说。比如让摘要更简洁一点,或者更关注技术细节,或者换成更轻松的语气。它会自动帮你调整,下次推送就生效。

对于做产品的人来说,这个 skill 还有一个隐藏价值:它帮你建立了一个高质量的信息参照系。

就像 Ovitz 说的那样,当你见过的人越多、读过的东西越多,你对新事物的判断就越准确。

持续追踪这些顶级建设者的思考,你会慢慢形成自己对行业的判断框架。

什么是真正的创新,什么是炒作,什么方向值得投入,什么坑不要踩,这些感觉会越来越清晰。

而这种判断力,才是做产品最核心的能力。

所以如果你也有信息焦虑,如果你也想更高效地追踪 AI 行业的动态,如果你也想关注那些真正在做事的人而不是网红,真的可以试试这个 skill。

装上它,你会发现,原来信息管理可以这么轻松。
02