即刻App年轻人的同好社区
下载
App内打开
被减数
198关注909被关注1夸夸
🤖 AIGC博士在读 | Build & Share AI Stuff
💭 写作、思考、工具与商业洞察
💬 V: Lessnoise365
被减数
8天前
用它们来做 bot 头像 不是更可爱吗?
11
被减数
15天前
这真的是中登最好的时代,有历史积累和审美素养的 AI 创作者,不断创作出惊艳作品。

观 Opus 5.5 做视频有感。

当然,少一些拿别人的分享,改几个提示词宣布自己开源,多一些引用来源更好。
00
被减数
19天前
Qwen-Image-2.1 7B 挺不错的~
原生支持透明底图生成,以及最多10张参考图的全局编辑,是让我眼前一亮的两个点。

Adob​​e 股票可以再跌一点~
00
被减数
24天前
X 这个桌面小组件还挺方便,

btw iOS 27 丝滑的不像话
00
被减数
26天前
RSS订阅工具,目前在 Folo 和 inoreader 中摇摆不定,
总不能真的在 Obsidian 中再造一遍吧~

还想要一个媲美 Reeder 的阅读器。
00
被减数
28天前
无法想象在超市买了食材,回家做什么饭被监控不说,
卖菜老板还要评价我做的差,因为不是“白人饭”
00
被减数
1月前
推荐几部日漫➡️
如果你二十多岁,推荐你看 《强风吹拂》;
如果你三十多岁,推荐你看 《摇曳露营△》;
如果你四十多岁,推荐你看 《悠哉日常大王》。
00
被减数
1月前
“语言即世界”,或许只是人类的一种自大。

这一轮 AI 的成功,很大程度上得益于 LLM 的突破。而语言,本身就是人类使用了上千年的思考工具。

维特根斯坦说过:
我语言的边界意味着我的世界的极限。

我们使用语言来思考和描述世界,但能够被描述的世界,并不一定就是世界本身。
处于马车时代的人无法想象今天的汽车,农民也只能想象皇帝耕地一定用的金锄头吧。

我们对未知的想象,很难真正逃离已经知道的东西,今天的 LLM 也面临类似的问题。它们学习了几乎所有人类的知识,越来越擅长回答已知的问题。

但如果答案根本还不存在呢?

这个时候,“生成一个看起来合理的答案”其实没有太大意义。

最近读了
@Apodex_AI
及其创始人
@tianqiao_chen
发布的论文和观点,里面抛出的核心问题非常深刻:

怎么让 AI 在一个答案尚未知、过程也尚未定义的现实问题里,持续行动、得到反馈、验证自己、修正自己,最后得到一个值得相信的结论?

过去我们使用AI,是人给 Prompt , AI 在已有 Context 中寻找答案。

但做未知领域的研究发现,我们需要另一套逻辑,让 AI 可以调用工具、运行代码、搜索证据、提出假设,再根据实验或环境返回的新信息不断修正自己的判断。

基于这个思路,Apodex 做了一个叫 TRACES 的 “Benchmark”。

把 Model、Tools、Memory、Harness 和 Agent Loop 放在一起,形成一个完整的 Solver System,基于此作为新的评估基准。

T (Tools):有没有选对并用对工具?
R (Repair):遇到错误后能否自主修复?
A (Alternatives):是否评估了其他可能的假设?
C (Coherence):长路径探索中逻辑能否保持一致?
E (Evidence):结论是否有真实证据支撑?
S (Scope):是否清晰界定了结论的边界与局限?

在此模式下,AI 获得的 Context 不再仅依赖初始 Prompt,是在与环境的持续交互中动态涌现。评估视角也随之改变:比起单次输出的“答案正确与否”,系统更关注这个答案“究竟是如何被推演和验证出来的”。TRACES 重点评估的是探索未知答案的逻辑严密度。

论文开头用 Apollo 登月做类比,十分精辟: 真正让人类登上月球的,不只是几个天才工程师,而是一整套围绕目标建立起来的工具、系统、反馈与持续纠错机制。

面对复杂未知,单纯的语言智能固然重要,但让智能沿着可靠路径持续自我迭代的系统,才是未来。
10
被减数
1月前
UU 远程,理论上有了高质量的 “computer use” 数据,
网易会做自己的 Manus 吗?
10
被减数
1月前
Minimax H3 你的结果是入局!

从H3发布到现在,目前视频生成的效果估计 Minimax 自己没有想到吧,股票都跟着涨了一轮。
这得益于社区内各路大佬、组织的二次优化。

当一个模型出厂可能仅 70 分,由于开源开放,全世界的开发者都能参与进来,完全可以帮它做到 90 分。

我发现有很多这类模式的成功产品:
Obsidian 的第三方插件、Comfyui 的第三方节点、包括现在火爆的 Omarchy 等等 ,都有自发的第三方开发者,自愿为爱发电。

回到大模型领域,各厂开源“大“模型,不如开源“小”模型,能让一些家用级别的设备也能参与进来,反而可能会促进自己下一代模型的进步。

开源 100 T 的模型,约等于没有开源。
00