即刻App年轻人的同好社区
下载
App内打开
Daotin
50关注460被关注0夸夸
记录生活,拥抱AI。
Daotin
5天前
🚴‍♂️
00
Daotin
11天前
今天开始,吃饭不看手机,好好吃饭。
00
Daotin
12天前
最近看到一个说法:人最好有三种爱好——一种运动型,一种表达型,一种沉浸型。

想了一下,我好像慢慢找到了自己的答案。

力量训练 —— 身体
碎碎念/短文字 —— 思想
摄影 —— 感受

力量训练已经坚持在做了。表达这件事,以后想多写一点,不一定是什么完整的文章,就是在即刻、X这些地方,记录一些突然冒出来的想法、生活感受,学习心的等。

摄影也想重新认真一点。

以前总觉得自己两点一线、天天上班加班,没什么值得拍的。但后来想想,摄影可能本来就不是非得去多远的地方。

下班时的一片晚霞,路边的树影,雨后的街道,办公室窗外某个瞬间,都可以拍。

拍得不好也没关系。

本来就是要拍很多废片,才会慢慢知道自己喜欢什么、怎么看这个世界。

爱好不一定非得有用,也不一定非得变现。

有一些事情,只是让身体更有力量,让脑子里那些一闪而过的东西留下来,让自己对生活重新保持一点感受力。

好像就已经很有用了。
00
Daotin
13天前
当下别想着做副业了。你没有那么多时间,每一件事情想做好,都得花费非常多的精力。

你现在的主要任务是把 AI Agent 开发学好,日常工作已经很忙,忙到需要加班的地步了,还要学这个东西,哪有时间折腾其他事情?这样只会让人心力交瘁,一件事都办不好。
00
Daotin
14天前
一大早的乐子,笑死了。
00
Daotin
16天前
我中午如果没有休息,或者睡不着,下午就无法集中精力,脑子发蒙的状态,有脑雾的感觉。

我发现解决办法也很简单:离开工位,去洗把脸,然后到户外去吹吹风,晒晒太阳,然后去爬楼梯或者跑步让心率起来,差不多10分钟再回来,“脑雾”情况就会好很多。
00
Daotin
17天前
后劲太足了😢
00
Daotin
19天前
终于去看了《龙餐馆》,开头那段的第一视角直接拍出了战争的残酷感。

看完有三个地方最动容。一个扎伊德的老婆孩子被枪打死,他把他们用窗帘拖到外面,抱着他们痛哭的时候,房子也被烧了,真的是家破人亡;一个是看到那么小的小孩被洗脑要背着炸弹去送死的时候;最后就是俊生死的时候。

还好最后小孩都活下来了。

在国内真好。愿世界和平。
00
Daotin
20天前
00
Daotin
21天前
GPT-6 Astra 最大的突破不只是写代码,而是能直接操作电脑完成真实工作。它在电脑操作、科研、数学、3D 建模和安全能力上提升明显。

1. 最大卖点:直接操作电脑

Astra 可以像人一样看屏幕、点击按钮、填写内容和处理报错,覆盖:

- Excel、Power BI、CRM、日历和网页表单
- 前端测试、软件安装和故障排查
- KiCad 电路板设计
- Blender 建模和 Unreal Engine 5 场景制作
- 法律文档排版
- 网站和小游戏制作

主要数据:

- OSWorld 2.0:72.6%,GPT-5.6 Sol 65.7%
- ScreenSpot-Pro:92.7%,Sol 76.9%
- AutomationBench:41.4%,Sol 18.1%
- 单个复杂任务平均耗时约 40 分钟,Sol 75 分钟

未来电脑图形界面可能会成为 Agent 最通用的操作入口。即使一个老系统没有 API,AI 也可以直接操作它的界面。

2. 数学和科研能力提升很大

- FrontierMath Tier 4:97.6%
- Terminal-Bench Science:64.6%
- BenchCAD:95.9%
- 512K 1M 长上下文测试:96.3%

Astra 还被描述为帮助改进了两个质数间隙问题,其中一个结果把已知界限从 240 推进到 186。

不过,也有人指出 Astra 并非所有综合测试都领先:

- Humanity’s Last Exam:57.2%,低于 Fable 5.1 65.0%
- Artificial Analysis Intelligence Index:61.2,低于 Fable 5.1 65.7%

3. 编程能力领先,但不是全面碾压

Astra Terminal-Bench 4.0 上是 57.9%,高于:

- Claude Fable 5.1:55.8%
- GPT-5.6 Sol:37.3%

但在其他编程测试里,Claude 仍有领先或基本持平的情况:

- FrontierCode:Astra 64.5%,Fable 5 64.9%
- Artificial Analysis Coding Agent Index:Astra 67.0,Opus 5 68.1%

所以更准确的说法是:

Astra 在“带工具完成完整工程任务”方面很强,但纯代码生成、代码修改和综合编程能力,还没有把 Claude 全面甩开。

4. ARC-AGI-3 接近满分

Astra ARC-AGI-3 上达到 99.9%,而 Sol 7.8%,Opus 5 30.2%。

这个测试不是普通的答题,而是把 AI 放进没有说明书的交互环境里,让它自己猜规则、试错并完成任务。

但因为这个成绩使用了 OpenAI 自己的工具流程,工具流程可能对成绩有较大影响。因此这个分数很惊人,但不能简单等同于“模型本身已经接近人类通用智能”。

5. Agent 的判断力和主动性更强

Astra 被描述为会:

- 对小问题自行做合理判断
- 遇到会改变结果的关键问题时,再向用户提问
- 提问后继续完成不依赖答案的工作
- 用户长时间不回复时,低风险部分继续推进
- Codex 中跨上下文窗口记录和搜索旧信息

这种“只把真正重要的 20% 问题交给人”的能力,可能比单纯提高回答准确率更适合日常工作。

6. 安全能力更强,但网络安全风险也更高

实验指出:

- 越权测试中,Sol 越权概率约 48%,Astra 0%
- ExploitBench:Astra 100%,Sol 78.5%
- 针对近期 V8 漏洞的内部测试:Astra 39%,Sol 5.5%
- Astra 测试过程中发现了两个此前未知的零日漏洞

因此 Astra OpenAI 定义为首个达到“Critical 网络安全能力等级”的模型。

对应的限制是:

- 默认拒绝编写漏洞利用证明代码
- 防御性代码审查和修复可以做
- 更高权限只提供给经过审核的防御方

7. 一个重要的隐患:思维过程更难监控

Astra 的思维链更短、更压缩,人类更难从它的推理文字中判断它是否准备越权或做危险事情。

相关数据是:

- Sol 的无思维链数学时间跨度:3.6 分钟
- Astra:30.9 分钟

也就是说,Astra 可能在不写长推理过程的情况下,直接解决更复杂的问题。

这带来一个矛盾:模型行为看起来更安全了,但人类通过阅读思维过程来监督它,反而变难。

8. 价格和开放情况

- API 模型名:`gpt-6-astra`
- 输入:每百万 Token 10 美元
- 输出:每百万 Token 50 美元
- 价格接近 Claude Fable 5.1
- Plus、Pro、Business、Enterprise 用户会分批获得
- Codex 增加跨上下文记笔记功能
- Astra 可以通过 ChatGPT Sites 创建并托管网站或小游戏

最后归纳:

gpt-6-astra的重点只有三个:

1. Astra 最明显的升级是“操作电脑”,不是单纯聊天或写代码。
2. 它在科研、数学、视觉理解和 Agent 工作流上表现突出。
3. 编程能力虽然很强,但还不能说全面超过 Claude。
01