“语言即世界”,或许只是人类的一种自大。
这一轮 AI 的成功,很大程度上得益于 LLM 的突破。而语言,本身就是人类使用了上千年的思考工具。
维特根斯坦说过:
我语言的边界意味着我的世界的极限。
我们使用语言来思考和描述世界,但能够被描述的世界,并不一定就是世界本身。
处于马车时代的人无法想象今天的汽车,农民也只能想象皇帝耕地一定用的金锄头吧。
我们对未知的想象,很难真正逃离已经知道的东西,今天的 LLM 也面临类似的问题。它们学习了几乎所有人类的知识,越来越擅长回答已知的问题。
但如果答案根本还不存在呢?
这个时候,“生成一个看起来合理的答案”其实没有太大意义。
最近读了
@Apodex_AI
及其创始人
@tianqiao_chen
发布的论文和观点,里面抛出的核心问题非常深刻:
怎么让 AI 在一个答案尚未知、过程也尚未定义的现实问题里,持续行动、得到反馈、验证自己、修正自己,最后得到一个值得相信的结论?
过去我们使用AI,是人给 Prompt , AI 在已有 Context 中寻找答案。
但做未知领域的研究发现,我们需要另一套逻辑,让 AI 可以调用工具、运行代码、搜索证据、提出假设,再根据实验或环境返回的新信息不断修正自己的判断。
基于这个思路,Apodex 做了一个叫 TRACES 的 “Benchmark”。
把 Model、Tools、Memory、Harness 和 Agent Loop 放在一起,形成一个完整的 Solver System,基于此作为新的评估基准。
T (Tools):有没有选对并用对工具?
R (Repair):遇到错误后能否自主修复?
A (Alternatives):是否评估了其他可能的假设?
C (Coherence):长路径探索中逻辑能否保持一致?
E (Evidence):结论是否有真实证据支撑?
S (Scope):是否清晰界定了结论的边界与局限?
在此模式下,AI 获得的 Context 不再仅依赖初始 Prompt,是在与环境的持续交互中动态涌现。评估视角也随之改变:比起单次输出的“答案正确与否”,系统更关注这个答案“究竟是如何被推演和验证出来的”。TRACES 重点评估的是探索未知答案的逻辑严密度。
论文开头用 Apollo 登月做类比,十分精辟: 真正让人类登上月球的,不只是几个天才工程师,而是一整套围绕目标建立起来的工具、系统、反馈与持续纠错机制。
面对复杂未知,单纯的语言智能固然重要,但让智能沿着可靠路径持续自我迭代的系统,才是未来。