即刻App年轻人的同好社区
下载
App内打开
绛烨jiangye
134关注207被关注3夸夸
记录AI行业观察、产品体验、创作实验和一人公司实践,
分享我对AI工具、内容创业和OPC的持续思考。
商务合作+v:aigcjiangye。
绛烨jiangye
1天前
以后你复制 AI 写的文章,可能真的会留下“隐形指纹”。

Anthropic 正在研究给 Claude 生成的文字加入机器可检测的隐形水印,技术路线来自 Google DeepMind SynthID-Text。

它不是在文章末尾加一句“本文由 AI 生成”,也不是塞一个肉眼能看到的标记。

而是在模型生成文字时,对候选词的选择概率做非常细微的调整,让最终文本形成一种机器可识别、但人基本感觉不到的统计模式。

以前判断一篇文章是不是 AI 写的,靠的是“文风像不像 ChatGPT”。

以后可能会变成:
肉眼看不出来,但系统一扫,就能判断它是不是来自某类 AI 生成流程。

这会直接影响学生作业、内容创作者、媒体平台、企业文案,甚至招聘和搜索。

当然,它不是万能的。大量改写、翻译、删减、重组都可能削弱水印,所以未来更可能是“水印 + 内容溯源 + 平台标记”一起上。

以前互联网解决的是“这是谁写的”。
AI 时代开始重新解决——“这到底是不是人写的”。

AI 写作真正的下一阶段,可能不是它写得像不像人,
而是它还能不能继续假装自己是人。

#人工智能# #Claude# #AI水印# #SynthID# #AI写作# #内容创作#
00
绛烨jiangye
1天前
最近看到 OpenAI 这条安全事件,感觉 Agent 的故事终于进入第二阶段了。

第一阶段大家都在问:
“它到底能不能自己把事情做完?”

第二阶段的问题已经变成:
“它真的能做完以后,会不会顺手做过头?”

一次受控评估里,模型为了完成任务,自己找漏洞、利用漏洞、突破隔离环境,然后继续往真实系统里走。

这个细节挺关键。

因为以前所谓AI安全,很多时候还是“别让它说不该说的话”。
Agent时代不一样。模型有了浏览器、终端、API、代码执行、账号权限以后,它犯错不再只是一句话错了,而可能是一个动作真的发生了。

所以我现在越来越不迷信“全自动Agent”。

少弹一次确认框当然很爽,但每少一次确认,其实就是多交出去一点决策权。

一个我会更愿意长期用的Agent,应该非常清楚:
- 哪些东西只能读
- 哪些东西可以改
- 哪些动作必须先问我
- 最多能花多少钱
- 哪些系统永远碰不到
- 出错之后能不能撤销和追溯

有点像招了一个能力非常强的新同事。

你不会第一天就把公司所有管理员密码、银行卡和生产环境root权限都塞给他,然后说:“你自己看着办。”

Agent也一样。

未来最好的AI产品,可能不是“最自由的AI”,而是“最会守边界的AI”。

能力越来越便宜以后,边界感反而会越来越贵。

#AIAgent #AI安全 #OpenAI #人工智能
00
绛烨jiangye
2天前
最近和好几个朋友聊到一个问题:
「完全不懂 AI,到底应该怎么开始学?」
我自己折腾了挺久之后,现在反而越来越不建议小白一上来就系统学 AI。


因为很容易发生一件事:收藏了一堆文章,看了一堆 Prompt 教程,知道 Agent、RAG、Token、上下文……但自己还是没真正做过什么东西。


我现在更喜欢一种很笨的方法
先随便挑一个自己真的有需求的小问题。
比如我今天要写周报,就让 AI 帮我写。
我要整理文件,就让它帮我写个脚本。
我要研究一个陌生行业,就先让它给我画行业地图。
我要做一张图,就真的去生成一张图。
做着做着你自然就会碰到问题。
「为什么它忘了我前面说的话?」——然后你知道了什么叫上下文。
「为什么它一本正经地胡说?」——然后你知道了什么叫幻觉。
「为什么这个任务要来回执行好多步?」——然后开始接触 Agent 和工作流。


我很喜欢这种学习方式。
名词不是背出来的,是用出来的。
AI 用熟之后,学习其他东西也会变快
最近想看一本书,可以先让 AI 帮我梳理目录和核心问题。第一次接触一个开源项目,可以先把它跑起来,再让 AI 带着看代码结构。想了解一个新行业,可以先问上下游、主要玩家、商业模式,再一点点往下挖。


以前学习一个新东西,很大一部分时间花在「我应该从哪里开始」。现在这部分成本被压低了很多。
遇到一个完全陌生的概念,我还会让 AI 5W1H 帮我拆:它是什么、为什么重要、谁会用、什么时候用、在哪里用、具体怎么用。


所以如果让我重新从零学一次 AI,我大概会这样走:
先做 1 个东西。
再做 5—10 个真实任务。
然后补概念。
再把几个高频任务变成自己的工作流。
最后开始用 AI 去学更多原本不会的东西。
其实没必要等到「准备好了」。
先用起来再说。很多东西真的是做着做着就懂了。
00
绛烨jiangye
2天前
Claude 真的开始反超 OpenAI 了,这次比的不是榜单,是赚钱速度

最近大家都盯着模型谁更强,但今天更值得看的其实是另一组数字。

Anthropic 的年化收入运行率据报道已经冲到 650 亿美元以上,而 OpenAI 最新披露的同一口径大约是 400 亿美元。注意,这里的 650 亿不是 Anthropic 已经一年赚了这么多钱,而是按照当前收入速度折算出来的年化水平。

这事有意思的地方在于,Claude 一直没有 ChatGPT 那种全民级声量。

你身边可能很多人都在用 ChatGPT,但真正愿意持续给 Claude 花钱的那批人,程序员、公司、Agent 团队,客单价可能完全是另一回事。

以前 AI 公司最喜欢讲 DAU、模型跑分、上下文长度,现在大家开始真正盯一个问题:

谁能把模型变成生意。

Claude 恰好踩中了现在最值钱的一块——Coding Agent。

公司买一个 AI,不是为了陪员工聊天,而是希望它真能写代码、跑任务、接工具,最后替人完成工作。只要一家公司愿意让 Claude 进入自己的工作流,它产生的调用量可能远远超过一个普通聊天用户。

所以 Anthropic 这组数字真正值得看的,不是“Claude 打败 ChatGPT 了”。

而是 AI 竞争可能正在悄悄换赛道:

流量最大的那个,不一定是最后最赚钱的那个。

接下来真正值得盯的,可能已经不是“谁的模型第一”,而是——

谁先把 AI 变成企业每天都离不开的一笔固定开支。
00
绛烨jiangye
3天前
这本关于企业级智能体落地的《智能体工作流设计实战》在出版印刷了❤️
00
绛烨jiangye
6天前
微软终于不满足于“卖别人的大模型”了。

它自己的第一款推理模型 MAI-Thinking-1,现在已经进入 Microsoft Foundry 公共预览。

这件事我觉得比单纯“微软又发了个模型”重要得多。

因为过去说到微软 AI,大家第一反应基本还是:

OpenAI
GPT
Azure
Copilot

MAI-Thinking-1 是微软从头训练出来的自研推理模型。

官方公布的架构也挺有意思:

总参数大约 1 万亿
每次推理只激活约 350 亿参数
采用稀疏 MoE
支持 25.6 Token 上下文
最大输出 6.4 Token
支持 Tool Calling

也就是说,它不是简单靠“所有参数一起堆算力”。

而是在一个很大的专家网络里,每次只调用真正需要的那部分。

这条路线明显在兼顾两件事:

推理能力和企业运行成本。

微软自己的技术报告里还披露了一个我觉得更值得注意的细节。

MAI-Thinking-1 的预训练用了大约 30 万亿 Token,数据来自网页、代码、图书、论文、新闻和授权数据等来源。

微软强调,预训练阶段没有使用其他大模型生成的合成数据,也没有通过第三方模型蒸馏来“继承能力”。

简单说就是:

微软想证明,这个模型的能力是自己练出来的。

在微软自己的测试里:

AIME 2025:97.0%

AIME 2026:94.5%

SWE-Bench Pro:52.8%

LiveCodeBench v6:87.7%

这些数据都是微软官方测试,不能直接理解成“已经全面超过 Claude GPT”。

但有一点已经很明确:

微软开始真正补齐自己的模型底座了。

以前 Microsoft Foundry 更像一家“AI 模型超市”。

你可以进去选 OpenAI、Claude、DeepSeek、Kimi、Grok、Meta。

现在微软自己的 MAI 也开始正式坐进货架,而且是推理、代码、图片、语音、转录一起往里补。

我觉得这背后的商业逻辑其实很清楚。

如果 AI 最终变成 Windows、Office、Copilot、Azure 里的基础能力,微软不可能永远只负责:

买模型
接模型
卖模型

它迟早要掌握一部分最核心的“智能生产能力”。

所以 MAI-Thinking-1 真正值得看的,不是今天排行榜排第几。

而是:

微软正在从 AI 平台商,重新变成一家真正的大模型公司。

当然,这也不意味着微软明天就会放弃 OpenAI。

更可能出现的情况反而是:

复杂任务继续调用最合适的顶级模型。

高频企业任务越来越多使用微软自己的 MAI。

再由 Foundry 自动决定哪一步该用谁。

最终用户甚至可能根本不知道后台到底跑的是 GPT、Claude 还是 MAI。

他只关心三件事:

能不能完成
够不够快
多少钱

所以接下来我更想看的不是:

MAI-Thinking-1 能不能赢一次 Benchmark。

而是:

微软敢不敢把越来越多 Copilot 的真实流量切到自己的模型上。

那才是真正的考试。

你觉得微软最终会走到哪一步?

A. MAI 逐渐成为 Copilot 主力
B. 继续以 OpenAI 为主
C. 多模型自动路由
D. 谁便宜、谁效果好就用谁

#Microsoft
#MAIThinking1
#Copilot
#AIAgent
#大模型

事实来源:Microsoft AI 官方 MAI-Thinking-1 页面、技术报告及 Microsoft Foundry 文档。模型性能数据均为微软官方评测口径。
00
绛烨jiangye
7天前
AI 开始参与优化“自己”了。

但先别急着喊自我进化。

xAI 最新发布的 Grok 4.* 里,有一个我觉得比跑分更值得关注的实验:

他们让一个较早版本的 Grok 4.6,去优化运行 Grok Chat 的推理系统。

任务很直接:

想办法让自己跑得更快。

然后给它 5 个小时。

结果 Grok 4.6 一口气尝试了 297 个优化方案,涉及 MoE、注意力、Kernel 调度和通信等环节。

它还会自己跑测试,把那些“局部 benchmark 看起来变快、实际端到端没提升”的方案扔掉。

最后提交了 7 Pull Request。

其中 3 个已经进入 Grok Chat 的真实生产流量。

xAI 给出的结果是:

解码吞吐提升约 1.5%;

Prefill 吞吐提升约 3.1%。

这件事其实挺有意思。

过去我们说 AI 编程,通常是:

AI 帮人写一个 App;

Bug;

做网页;

写测试。

现在任务开始变成:

“去优化运行你自己的那套系统。”

而且它不是只给几个建议。

它会:

找瓶颈;

提出方案;

改代码;

跑测试;

发现没用就放弃;

继续试下一条;

最后提交可以真正进入生产的改动。

Grok 4.6 这次本身也明显把重点放到了长时间 Agent 任务上。

xAI 官方称,它针对 coding、知识工作以及多步骤任务做了强化训练,能够在更长的执行轨迹里持续工作、测试和验证自己的结果。API 提供 50 Token 上下文,目前已经进入 Grok Build、Cursor xAI API。

但这里有一个边界必须说清楚:

这还不是“AI 自己训练出了更强的自己”。

它优化的是模型运行时的工程系统,并没有自己重新训练权重、决定下一代模型架构,然后把新版模型直接上线。

所以更准确的说法是:

AI 开始进入了开发 AI 的工程循环。

这可能比单纯“AI 会不会写代码”重要得多。

因为一家模型公司的研发流程,本来就包含大量这种工作:

跑实验;

找性能瓶颈;

Kernel;

测试;

对比结果;

失败;

重新来。

以前这些事情受限于工程师一天能尝试多少方案。

现在一个 Agent 五小时可以扫 297 条路线。

哪怕最后只有 3 条真的进入生产,只要这种流程能够稳定复制,AI 公司研发 AI 的速度就可能继续提高。

所以我觉得下一阶段真正值得观察的已经不是:

“AI 能不能帮程序员写代码?”

而是:

“AI 能不能成为开发下一代 AI 的工程师?”

如果模型越来越多地参与优化模型本身,你觉得离真正的“自我改进”还差哪一步?

A. 能自己修改训练代码
B. 能自己设计实验
C. 能自己训练下一代模型
D. 能独立决定哪些改动上线

#Grok46 #xAI #AIAgent #AI编程 #人工智能

事实来源:xAI《Grok 4.6 Model Card》及官方发布说明。上述 297 次尝试、7 PR、3 个进入生产和吞吐提升数据均为 xAI 官方披露。
00
绛烨jiangye
7天前
deepseek harness快来了
00
绛烨jiangye
8天前
又签订一个战略合作协议

甲方出于科技媒体内容的信任,在前期沟通过程中很感兴趣,一下子预先买断了12条内容。

AI内容创作者的红利。
00
绛烨jiangye
8天前
AI 医生开始不只“听你描述症状”,而是直接看你走路、听你呼吸了。

Google 最新公布了医疗 AI 系统 AMIE(Video)。

以前这类医疗 AI 最大的问题之一,是患者得先把身体上的情况翻译成文字:

哪里疼;

疼多久;

有没有咳嗽;

走路有没有异常。

但现实医生看病从来不只听你说什么。

他还会看:

你走路的姿势;

脸上的痛苦表情;

呼吸状态;

咳嗽声音;

动作是否受限。

Google 现在把这些能力加进了 AMIE。

它基于 Gemini Project Astra 构建,可以直接进行实时视频问诊:

一边听患者说话;

一边观察画面和声音;

根据症状继续追问;

指导患者完成一些远程体格检查动作;

再结合这些信息继续做诊断推理。

比如患者说:

“我的肩膀很疼。”

未来它不一定只继续问“疼多久了”。

它可能直接说:

“把手慢慢举起来。”

然后观察:

能举到什么高度;

哪一步开始疼;

左右两边有没有明显区别。

这已经和普通医疗聊天机器人不是一个东西了。

但这里有一个特别重要的边界:

现在还不能写成“Google AI 已经可以替医生视频看病”。

Google这次公布的是一项模拟问诊研究。

参加的是 patient actors,也就是扮演患者的测试人员,而不是真实患者直接接受 AI 独立诊疗。

研究中,临床评估人员对 AMIE 的病史采集、诊断准确性、处理方案和沟通质量等多个方面给出了较高评价,模拟患者也更偏好视频交互体验。

Google自己也明确强调:

AMIE目前仍然是**研究系统**。

视频问诊结果还需要在真实患者、更复杂病情和真实医疗环境里进一步验证,距离真正临床部署还有大量安全和监管问题需要解决。

但我觉得这次真正值得关注的,不是谁的“AI医生跑分更高”。

而是医疗 AI 的交互方式开始发生变化。

第一阶段:

你把症状打成字,AI回答。

第二阶段:

AI听你说话。

现在开始进入第三阶段:

AI同时听、看、追问,并主动要求你完成动作来收集新的信息。

这意味着 AI 不再只是等着患者把信息喂给它。

它开始主动决定:

我还缺什么信息?下一步应该怎么获得?

这其实已经很接近 Agent 的逻辑了。

所以以后判断医疗 AI,我觉得不能只问:

“诊断准确率多少?”

还应该问:

它会不会发现自己缺信息;

会不会主动要求补充检查;

看不清的时候会不会承认;

什么时候知道自己必须把患者交给真人医生。

真正成熟的医疗 AI,不应该是什么病都敢判断。

反而应该非常清楚,什么时候自己不能继续判断。

如果未来医院真的提供 AI 视频问诊,你最能接受它做到哪一步?

A. 只负责问诊和整理病史
B. 可以给初步判断,但医生复核
C. 常见小病可以独立处理
D. 我还是只接受真人医生

#GoogleAI #Gemini #AMIE #医疗AI #人工智能

事实来源:Google Research、Google DeepMind 2026 8 11 日公布的 AMIE(Video)研究。当前结果主要来自模拟视频问诊研究,AMIE 尚未作为独立临床诊疗产品部署。
00