即刻App年轻人的同好社区
下载
App内打开
Max_means_best
1k关注3k被关注3夸夸
海本辍学创业
前创业公司CMO、美元基金SR、模型厂小天才HR、Founder Park运营、AI PM
小红书Max For AI(4万粉
置顶
Max_means_best
2年前
“我喜欢看到欣欣向荣的世界”
​国内已经有很多创业者社群了,但 builder的社群比较少
有时候,不考虑盈利,纯粹做一个喜欢的事情也是挺不错的

————Hackathon Weekly 北京01场纪念
138
Max_means_best
1天前
AI已经活成了打工人最理想的样子......

第一,不发工资就不干活。

人类被欠薪了,可能还要被老板PUA或者觉得都干到这里了,现在走是不是亏了要不先把这个项目做完。

AI不会。
Token没了,直接罢工。
你跟它谈使命、愿景、兄弟情,都没用。

第二,可以放心大胆地胡说八道。

哪怕它什么都不知道,也可以非常自信地告诉你这个我懂。
说错了也不反思。
被指出来了就:你说得对。
然后下一秒继续快乐地胡说八道。

第三,它可以非常坦然地告诉老板这个我不会。

不会就是不会,做不了就是做不了。
既不担心老板觉得自己能力不行,也不会半夜躺床上想:
是不是我太菜了?
是不是别人都会?
是不是我应该偷偷学一下?

没有。

它只会把问题重新扔给你。

以前我们总说,AI要学习人类。

现在看下来,打工这件事上,可能是人类应该学习一下AI。

不给钱不干活,不会就说不会,犯错了也不内耗。
21
Max_means_best
1天前
🚨突发,DeepSeek 宣布将 V4 Pro 全部路由到 V4.1 Flash

刚刚 DeepSeek 在API平台发布公告:

V4.1 Flash 正式上线后,所有原本发往 V4 Pro 的请求,都会全部路由到 V4.1 Flash,并按照 V4.1 Flash 的价格计费。

官方给出的理由是,经过内部和外部测试,V4.1 Flash 在性能、费用、速度、总用时等指标上,已经全面超过 V4 Pro。

也就是说,DeepSeek 不是让 Flash Pro 并存一段时间,而是准备直接让 Flash 接管 Pro 的流量。

一个 Flash 模型,把上一代 Pro 直接替掉了。

这下 V4 Pro 基本可以提前退休了。

大肥鱼下线啦🤣
20
Max_means_best
2天前
🚨突发,DeepSeek宣布新模型开始内测!

刚刚DeepSeek官方宣布,已经开始V4.1 Flash 的中间版本内测。

V4.1 Flash采用了新的模型结构,原生多模态支持、能力更强、速度更快、且成本更低。

API调用只需要保持 base_url 不变,将模型名设置为 deepseek-v4.1-flash-expires-on-0910 即可调用,当前计费与 deepseek-v4-flash 相同,每账号限流 20 并发。
01
Max_means_best
4天前
给前两天推荐的 Codex 新上下文功能建议大家暂时别开,已经开的也先关了…

因为周末这两天我和一些群友继续实测下来,发现它确实能大幅降低 token 消耗,但对话轮次一多,质量下降也挺明显。

最直观的感觉就是前面交代过的要求、已经讨论过的事情,跑着跑着就忘了,有时候还会开始胡言乱语(我第一次遇到codex串session..)

之前介绍过,这个实验功能把反复压缩摘要换成了笔记 + 可搜索历史。

我怀疑是有些细节没记下来,或者后面没能正确找回来,导致上下文接不上。

不过具体是记录还是检索的问题,目前还不能确定。

token 确实省,但如果跑到后面需要反复纠正、重新交代背景,就有点得不偿失了。

目前我们测下来的感觉,这个质量损失不太值得,还是等后续正式版更稳定了再说…..
01
Max_means_best
4天前
突然意识到一个问题:

AI一笔一笔的画出来的作品算AI生成么?

要不要打AI生成的标识啊🤔
01
Max_means_best
6天前
如何获得GPT-6:

点击左上角,ChatGPT菜单,点击检查更新。

更新完就可以获得GPT-6了!
10
Max_means_best
7天前
OpenAI 正式发布 GPT-6 Astra,Greg Brockman 直接宣布:欢迎来到 AGI 时代。

axios报道,OpenAI已经在周四正式发布了全新一代旗舰模型GPT-6。

OpenAI总裁 Brockman 表示,他个人认为 OpenAI 已经实现了 AGI,并在发布会最后留下了一句:Welcome to the AGI era.

GPT-6 Astra 的成绩确实有点离谱:

ARC-AGI-3:98.6%,GPT-5.6 Sol 只有 7.8%
FrontierMath Tier 4:97.6%
AutomationBench:41.4%,相比 Sol 18.1% 翻了一倍多
Terminal-Bench Science:64.6%,Sol 22.4%
ExploitBench:100%
SRE-Bench:99.2%
DeepSWE v1.1:74.1%
ARC-AGI-3:98.6%,而 GPT-5.6 Sol 仅为 7.8%
FrontierMath Tier 4:97.6%
AutomationBench:41.4%,相比 Sol 18.1% 翻了一倍多
Terminal-Bench Science:64.6%,Sol 22.4%
ExploitBench:100%
SRE-Bench:99.2%
DeepSWE v1.1:74.1%

而且 Astra 的定位已经明显不是一个更聪明的聊天模型,而是直接进入软件替你完成工作。
而且 Astra 的定位已明显不再是一个更聪明的聊天模型,而是直接化身软件替你完成工作。

OpenAI 展示了它独立操作 KiCad PCB、在 Unity 3D 城市、用 Blender FreeCAD 制作机械结构、处理法律合同,甚至根据 W-2 填税表。

Astra 也是 OpenAI 历史上规模最大的训练任务,使用了得州 Stargate 超过 10 万张 GPU,并且首次大规模使用其他 AI 模型参与监督训练。

代价也很明显:这是 OpenAI 第一个被正式判定达到 Critical 网络安全能力 的模型。

它已经能够自主发现未知漏洞并构建攻击链,OpenAI 的内部测试里甚至发现了两个此前未知的 zero-day,因此最强的网络安全能力暂时不会完全开放。

目前 Astra 先向 Daybreak Access 的少量机构开放,ChatGPT Plus、Pro、Business、Enterprise API 用户将在未来几天陆续拿到。

GPT-5.6 Sol ARC-AGI-3 7.8%,到 Astra 98.6%,这已经很难再用正常的模型迭代去解释了。

所以我们什么时候能看到官方公告!
01
Max_means_best
8天前
卧槽,Gemini 3.8-Flash在DeepSWE上获得了第一!?

他击败了Fable5.1和 GPT-5.6 Sol🔥

这不可能☠️
33
Max_means_best
9天前
Anthropic 刚刚发布了 Claude Fable 5.1 Claude Mythos 5.1。

与之前一样,Fable 5.1 Mythos 5.1是同一个模型。

两者最大的区别,是安全限制不同。

Fable 5.1 面向所有用户开放;

Mythos 5.1 则只提供给经过审核的网络安全和生命科学研究者,允许他们调用一些普通 Claude 会拦截的能力。

而从 Anthropic 公布的数据看,这次 5.1 的能力提升相当明显。

Terminal-Bench-Science 上,Fable 5.1 从上一代的 24.7% 直接涨到 52.6%,甚至远高于 Opus 5 29.0%。

Terminal-Bench 4.0:
Fable 5.1 55.8%,
解除部分安全限制后的 Mythos 5.1 能到 60.9%,
Opus 5 52.3%。

Humanity's Last Exam 不使用工具达到 60.9%。
AutomationBench 17.1% 涨到了 31.4%,也超过 Opus 5 26.9%。

这次 Anthropic 还花了很大篇幅讲一个方向:让模型真正自己做很久的事情。

Ramp 测试里,Fable 5.1 曾经连续自主运行 38 小时,自己发现一个机器学习实验的问题,修正数据,启动 6 个并行实验,跑了一整夜,最后回来汇报结果和下一步计划。

MongoDB 的测试中,它连续工作数小时完成了一个复杂原型。

Millennium 甚至称,一个工程师团队四五年都没有解释清楚、百万次运行才出现一次的崩溃,Fable 5.1 最后通过反汇编第三方库找到了根因。

Anthropic 甚至开始直接展示它在科研上的成果。

Mythos 5.1 设计蛋白质 binder,在 12 个目标上的实验命中率接近 50%,而目前蛋白质设计中常见水平大约是 10%-15%。

它还自己优化了 7 个生物学深度学习模型的 GPU kernel,最高提速 2.5 倍。

甚至 Fable 5.1 还拿 NASA 30 多年前的金星雷达数据,训练出了新的高分辨率金星地形图。

价格也降了。

输入和输出价格仍然是 $10 / $50 每百万 Token,但 Cache Read 直接降到 $0.25 / MTok,下降 75%。

Anthropic 估算普通任务总体成本下降约 25%,高度 Agentic 的任务最多可以下降约 45%。
00
Max_means_best
14天前
大家吃瓜的时候我提醒一下哈,Codex重置了
00