Instinct 的单线程对话流 = TikTok 的沉浸式单列流
早期模型的上下文太小,GPT-3.5 只有 4k token,GPT-6 现在有 100 万+ token,而且压缩也越来越好,好的 to C 产品,不该要求用户先把自己整理好,再来用你。
TikTok 的单列流,干掉的不只是"分类"这个界面元素。它干掉的是一种假设:假设用户在消费之前,先知道自己想要什么。用户根本说不清自己想看什么,或者说,"想看什么"是流动的,是在看的过程中才长出来的。所以它把"你先想清楚"这个前置要求取消了。你不需要整理好自己,你只需要出现,剩下的我来。
Instinct 的单线程,是把同一个取消动作,做在了"表达"这一侧。
多线程聊天的潜台词就是:在你开口之前,先把自己整理好。这句话属于哪个任务?跟上一句什么关系?要不要开个新 thread?每个问题,都是让用户替机器做一次分类。GPT-3.5 只有 4k 的时候,这是没办法,机器记不住,用户只好自己当索引。但 100 万 token 的今天,还保留这个前置要求,性质就变了:它不再是无奈,而是把旧时代的约束包装成"功能",继续向用户收税。
这两件事恰好是对称的。TikTok 取消的是消费侧的"你先想清楚想看什么",Instinct 取消的是表达侧的"你先想清楚想说什么、归到哪"。消费和表达,是人跟信息打交道的两端,而两端被取消的是同一个东西:预先整理自己的义务。
这也是"沉浸式"真正的来源。沉浸感从来不是画质给的,沉浸感来自"没有被打断"。每一次要你做决定的界面,都是一次打断:它把你从"我在看"拽出来,变成"我在选"。多线程也一样,每一次让你选 thread,都是把你从"我在说"拽出来,变成"我在归档"。你本来在跟一个人说话,突然被要求当一回档案管理员,再小的打断,攒多了就是出戏。TikTok 的全屏单列和 Instinct 的单 thread,做的都是同一件事:别打断我。
往深了说,这背后是 to C 产品的一个基本判断:用户愿意把"我要什么"的答案外包出去。
这听起来反直觉,但 TikTok 已经验证过了。没人觉得把"下一条看什么"交给算法是失控,反而觉得爽。为什么?因为"我要什么"这个问题,人自己答起来也很累。你以为你知道自己想看什么,其实你只知道个大概,剩下全是"看了才知道"。TikTok 的哲学就是承认这一点:别问用户要答案,直接给候选,让手指投票。
Instinct 赌的是同一句:用户也答不好"我这句话到底想办什么"。很多消息发出去的时候,连用户自己都没想清楚,"帮我看看那个机票"到底是想比价、想改签,还是随口一提。多线程逼你在没想清楚之前先分类,分错了上下文就断,断了就得把话再说一遍。单线程允许你没想清楚就开口,因为"想清楚"这件事,harness 可以替你后补。记忆、压缩、task 的派生,这些不是"功能",是系统替你把没想清楚的部分圆回去。
所以这两者的联动,根本不是"都是单列"这种排版层面的巧合。它们是同一个范式转移在两个领域各开的一枪:从"用户整理好自己来适应机器",到"机器去理解没整理好的用户"。频道和 thread,都是旧范式的遗物,它们存在的理由只有一个:机器记不住,所以用户必须预先把现实切好、喂给它。当机器能记住、能推出、能自己收拾,还让用户继续切,就是倒行逆施。
当然,单线程今天有代价:所有事挤在一个 thread 里,重度用户会晕,分不清每件事的状态。但这恰恰说明它赌的是什么:赌 harness 脏活的进化速度,超过用户对"自己当图书管理员"这件事的忍耐度。赌注的胜负且另说,方向没有问题。因为另一条路是让用户永远替机器打工,而这条路跟人性对着干,注定越走越窄。