即刻App年轻人的同好社区
下载
App内打开
饼干哥哥
55关注1k被关注0夸夸
10 年数据分析师,现在专注 AI 编程与 agent
饼干哥哥
12天前
DeepSeek Harness必装的15个插件

DeepSeek Harness开源了,先别让手头上的Codex、CC下岗,因为它跟半成品没区别。
DSH「一切皆插件」的概念还蛮酷。
实际意思是装完以后连传文件、识图的功能都没有。。。

需要啥功能、就装啥插件。
所以现阶段面向的就是开发者,使用门槛还是有的,建议普通用户先观望吧。

想玩玩用这个指令,直接给到本地 Agent:


帮我安装并启动 DeepSeek Harness。
项目地址:github.com/deepseek-ai/deepseek-harness
先检查环境,缺什么装什么。
然后运行 npx @deepseek-ai/dsh web 并打开网页端。


跑完浏览器会弹出Web UI,然后填上 DeepSeek API Key 就能用。
Key platform.deepseek.com 充钱创建,也可以从设置那里自定义模型。

装完只是开始,界面纯纯空壳。
所以必装插件我列了个清单,下面可汗大点兵:

第一梯队
ModLens:识图
dsh-at-file:输入框打@引用文件
dsh-paste-input:Ctrl+V 粘贴、拖拽文件进对话框
dsh-office:读写 docx、pdf、pptx
dsh-browser-panel:内嵌浏览器,Agent操作网页
dsh-computer-use:Agent操作桌面,仅 macOS

第二梯队
safe-find-dsh-plugins:说需求自动找插件
dsh-web-ui:全家桶之任务看板、Git、手机远程、Token统计
dsh-genui:回复里渲染图表、表格、组件
dsh-turn-rewind:一键回退
dsh-message-edit:编辑已发消息、重新生成

第三梯队
dsh-agent-teams:多 Agent 干活
dsh-memory-evolve:跨会话长期记忆
dsh-llm-fallbacks:模型挂了自动切备用
dsh-feishu-bot:接飞书机器人

不止这些,这个页面(github.com/topics/dsh-plugin)目前收录了1000+插件了。
DSH 跟组装乐高一样,可玩性很高。
感觉是对标 pi,有没有人来讨论下哈哈哈哈。
10
饼干哥哥
17天前
顶级 AI 模型价格被腰斩后,会发生什么?

Grok 4.6这波跟上了 DeepSeek梁子的节奏,与 GPT-5.6 Sol 同样的能力,但价格直接腰斩。

我理解,这不是一次促销,而是长期趋势。

Epoch AI 估算,达到同等能力水平的推理成本,大约每年下降 5—10 倍。

当顶级模型足够便宜,第一件事不是大家少花钱。

而是开始挥霍智能。

以前一次问答,未来可以是十个 Agent 并行。
以前人工抽查,未来可以让三个模型相互审核。

廉价的不是AI,而是可调用的判断力
——从“谁最聪明”,变成“一个任务到底多少钱、跑多久、失败几次”。

因为 token 单价低,不代表最终任务成本低。Agent 会循环、重试、读取长上下文,甚至持续工作几个小时。

最后很可能出现杰文斯悖论:

每个 token 越便宜,企业消耗的 token 反而越多。模型公司降价后,不一定少赚钱,反而会释放出过去根本不成立的新需求。

AI 产品来说,很多原本只能做一次性交付的功能,会升级成持续监控、自动复盘、主动执行的长期服务。产品竞争也会从“生成一个结果”,变成“持续把事情做到达标”。

AI 成为基建,不是因为它无所不能。

而是因为它便宜到,可以被浪费。
00
饼干哥哥
1月前
Codex 必改的8 个基础配置
我是饼干哥哥,我给NGS每人配了200美金的Codex Pro。
结果上周团队有人跟我说:
Codex不如豆包好用,离了他一点活都干不了!!

我大为震撼,明明同一套餐,另一边已经蹬疯了。。
我把两边的设置拉出来一对比,不是Codex 的问题,是这8个配置没动,大家自查!

01 权限模式
点设置 常规 权限 打开完全访问权限。
默认权限每次改文件都要问一遍,平时我都无脑开最大权限,省得被弹窗打断。

02 个性化
点开左下角设置,找到个性化。
语气从默认"亲和"改成"务实",少说废话;
记忆功能打开,记住用户偏好;
自定义指令上GitHub搜"forrestchang/andrej-karpathy-skills",卡帕西吐槽Agent写的那份开源规则,整段复制粘贴进去就行。

03 跟进行为
点开左下角设置,找到常规。
编辑器下面把默认的"排队"切成"引导";
任务跑到一半能随时插话纠错,不用等跑完再返工。

04 会话管理
会话卡死、上下文太长没救了。
右键任务"复制会话ID",给到另一个对话框继续改;
如果是背景全但想另开路线,选"在新任务中继续"。

05 电脑操控
设置里找"电脑操控",打开"任意应用"和Google Chrome这两栏;
日常操作App、刷网页,让 Codex 爽玩你的电脑。

06 搜索任务
任务多了翻不到,点左侧边栏上方搜索图标🔍
弹出面板直接搜任务,比翻列表快。

07 语音听写
设置里点"语音",设好快捷键;
随时随地开始口喷,自动转中文,比打字都快。

08 重连接问题
如果总遇到"正在重新连接5/5"这问题,是Codex想走WebSocket,代理不支持就反复重连。

先把下面提示词丢给Codex修复:

请帮我修复"重连接"问题:
备份config.toml为config.toml.bak,新增provider(名openai_http,wire_api=responses,supports_websockets=false,requires_openai_auth=true,已有同名则跳过),顶部model_provider改成openai_http,完成后告诉我改了什么。


如果还卡,还有个方法:


帮我检测本地代理端口,先检查.codex/.env是否已存在并备份现有内容,查到端口就更新或追加代理这两行,不要整体覆盖;
查不到再问我;完成后告诉我具体改了什么、端口怎么确定的。

然后重启就 ok 了。

(* 改完如果发现会话变少了,是按 provider 分组的正常现象,改回去就行了。)
21
饼干哥哥
1月前
真的看不懂高铁的售票逻辑
我自己一个人出行
上车的时候,诺大的车厢空无一人
庆幸可以以 1 个人坐的时候
就上来一位乘客,非常精准的坐到了我的旁边
不是,这么多位置,为什么要匹配我啊?
整个车厢就我们俩,这合理吗?
21
饼干哥哥
2月前
如何给传统网站加上 Agent,让 AI 操作一切

上一篇提到我在做的 ngsFlow,要加一个 Canvas Agent 操作画布的踩坑经验。

现在跑出来了,关键在网站要把自己的业务能力整理成一套 Agent 可以理解和调用的产品协议。

如果你也在经营网站,想让 Codex 帮你加一个 Agent AI 替用户操作功能,可以参考提示词:

```text
请分析当前网站代码库,并设计一套让 Agent 深度操作网站功能的改造方案。

要求:

1. 不替换现有业务流程、数据库、API 和任务系统,Agent 只作为旁路编排层。
2. 梳理网站现有核心能力,建立统一 Capability Catalog,避免在不同页面、CLI、MCP 中重复维护工具定义。
3. Agent 每次先读取当前页面和项目状态,再生成声明式执行计划。
4. 所有写操作必须支持 dry-run、变更预览、一次确认、原子提交、版本冲突检测和撤销。
5. 付费、删除、覆盖、发布、本地命令等操作增加独立审批和预算限制。
6. 长任务使用持久化 Run/Job 状态,不依赖一个长 HTTP 请求。
7. 执行完成后必须通过确定性条件验证,不能仅凭模型回复判断成功。
8. 建立统一 Trace,记录 run、turn、tool、审批、耗时、结果、失败原因和敏感信息脱敏。
9. 全局 Agent UI 可以常驻,但会话、权限和上下文必须按用户、项目和页面隔离。
10. 保持旧功能和旧客户端兼容,给出分阶段实施方案、公共接口、数据表、核心类型、测试计划和回滚策略。

请先进行只读代码审计,再输出:
- 当前架构与主要问题
- 目标架构图
- 分阶段改造计划
- 需要新增或修改的模块
- 风险与兼容策略
- 可验证的验收标准

不要直接大规模重写代码,优先复用现有业务能力和任务系统。
```

协议整理好之后,接入方随便换:网页侧栏 Agent、本地 Codex / Claude Code CLI MCP 都能用
00
饼干哥哥
2月前
复盘一个典型的 Agent Harness 问题

上篇讲到我在开发 ngsFlow AI画布,有个 Canvas Agent 可以帮用户直接搭工作流。但结果很尴尬:它只能稳定完成 3 个节点左右的简单连线,一旦涉及复杂需求,就开始漏节点、连错线、做到一半停下来说"完成了"。

后来专门去读了 Anthropic、OpenAI 的公开实践分享,才发现这是个典型的 Agent Harness 问题。(可以直接拉到文末看解决方案)

Harness 不是模型,而是模型外面的整套执行环境:
Agent 怎么理解产品状态,怎么选择工具,怎么规划步骤,怎么安全执行,怎么验证结果,失败之后怎么恢复。

MCP 解决的是“怎么接进来”,CLI 解决的是“怎么调用”。
但它们都不保证 Agent 能完成复杂任务。

具体到 ngsFlow,问题有三个。
第一,工具重叠严重:多个工具都能建节点,Agent 每一步都要先纠结用哪个,工具越多选择越差。
第二,Agent 要自己管理节点 UUID、自己算坐标、自己维持十几步调用之间的状态,这些恰恰是模型最不擅长的。
第三,没有验证环节,工具调用返回成功,Agent 就认为任务完成了,至于画布上是不是真的有 10 个节点,没人检查。

怎么破?大厂的解法可以总结成 5 个点:

1. 收敛成少量高层工具。
Anthropic 明确说过,把产品 API 原样包成几十个工具是常见错误。应该提供面向完整工作流的工具,比如"创建一条生成流程",内部的多次操作由产品自己完成。原子工具留在底层,不默认暴露给模型。

2. Agent 提交声明式 Plan,而不是几十次离散调用。

Agent 只需要描述要创建哪些节点、怎么连接、布局目标和完成条件。真实 ID、坐标计算、批量循环和事务提交,都交给确定性的 Runtime。

3. 确认粒度提到计划级。

不要每建一个节点弹一次确认。先 dry-run 展示完整预览和预计费用,用户确认一次,然后原子执行。否则长任务天然被切碎。

4. 复杂批处理交给受限 Code Mode。

创建 10 个节点、批量连线这类任务,让 Agent 在沙箱里调用领域 SDK 写循环,通常比连续调用十几次 MCP 更稳定。

5. 强制验证。

Plan 里内置后置条件:节点数量对不对、有没有断线、有没有重叠。执行完由 Runtime 重新读取状态逐条检查,不通过就进入修复循环,通过才算完成。MCP-Atlas 基准显示,大量失败发生在工具全部调用成功之后——模型提前停了。

一句话概括这套 Harness 的思路:模型负责决定要什么,Runtime 负责保证做对。
00
饼干哥哥
2月前
小龙虾,终究只是南柯一梦。

不敢说小龙虾已死。要不然又会有人来骂我制造焦虑了。

但事实上,我身边的圈子都已经没人再提了。

取而代之的,是各种「work」产品:workbuddy、kimi work,qoderwork,还有什么 work?

最近一直在思考,变与不变的边界在哪里?但我觉得一切在应用层上投机取巧的产品,都会被大模型级别的超级产品杀死。

例如 codex

所以我选择一步到位,给团队所有人装上了 Codex,有的甚至配上 MacOS,直接操作一切

例如 结合飞书cli 做各种表格文档,甚至搭建多维表格工作流,结合即梦cli TikTok 视频

接下来所有知名产品都会有 cli作为 Agent 入口。Codex 的生态就能野蛮生长了。

美中不足的是,codex 还没有 ChatGPT 的知识和逻辑推理能力。

但很快 chatpgt codex 会合并,变成超级应用后,一大批做中间管道的产品又会死掉。

而这一切,从 openclaw 过年兴起火出圈至今弥留之际,不过短短 3 个月
21
饼干哥哥
2月前
ChatGPT Ads:AI 入口开始变成广告入口

最近一直在看新的海外营销渠道,毕竟我们 NGS 自己就在给跨境品牌做 Reddit

目前我比较看好的两个方向:Reddit Ads ChatGPT Ads。最近问的人明显变多,甚至有朋友说,后台从 ChatGPT 过来的订单比例翻倍了。

再研究,我发现 AI 入口出现后,广告逻辑开始变了。

用户买东西前,他可能直接打开 ChatGPT,问一句:
300 美金以内买什么耳机?
露营用便携电源怎么选?
某两个品牌哪个更适合我?
有什么比 Dyson 更便宜的替代品?

所以 ChatGPT Ads 真正值得关注的地方,是它把广告位放进了用户做决定的过程中。

这和搜索广告不一样。

搜索广告等用户把需求变成关键词。ChatGPT Ads 看的是用户正在聊什么、比较什么、犹豫什么。需求还没完全变成搜索词,广告已经有机会出现。

这也是为什么我觉得它会影响跨境电商投放。尤其是那些需要研究、需要比较、客单价又不低的品类,比如 3C、智能硬件、户外装备、家居小电器、功能型 DTC 产品。

低价冲动品可能还是更适合 TikTok Meta。但如果用户买前会反复问参数、场景、替代品、性价比,ChatGPT 就会变成一个很重要的中间入口。

从目前看到的数据看,这个渠道还早,但已经不是纯概念。

根据《ChatGPT Ads 出海白皮书》,ChatGPT 周活约 9 亿,日均提问量超过 25 亿。广告上线约六周,年化广告收入已经接近 1 亿美元量级。
ChatGPT Ads 的合理 CTR 区间大约在 1.5% 6%

行业差异也很明显。

AI 工具 / SaaS CTR 大约 5.4%,CPC 1.1 美元;
内容和效率类应用 CTR 5.1%;
3C / 智能硬件 CTR 2.9%,CPC 1.9 美元;
流量加权综合大约是 4.0% CTR、1.6 美元 CPC

再对比一下其他数据。

同样是 AI 对话内广告,ChatGPT Ads CTR 3.99%,普通 Chatbot 广告约 0.40%,差不多是 10 倍。CPC 虽然也更高,大约 1.6 美元 vs 0.8 美元,但这里看的不是便宜点击,而是有效点击。

便宜流量不稀缺,能进入真实决策链路的流量才稀缺。很多渠道的问题是点击很多,但用户没有带着问题进来。ChatGPT 反过来,用户先把问题说清楚,广告才有机会出现。

当然,这个渠道还在非常早期。数据样本有限,很多结论只能当方向看,不能直接当稳定 ROI。

但我觉得,越是早期,越值得关注它的广告逻辑变化

下一篇我再专门讲:ChatGPT Ads 现在真正的问题出在哪,以及如果跨境品牌想测试,应该怎么避坑、怎么搭归因、怎么判断它到底有没有带来增量
01
饼干哥哥
2月前
现代 AI 产品开发三件套:GUI、CLI、飞书。
最近一直在开发一个 AI 视频产品。

形式上是 ComfyUI 的自由画布 + n8n 的工作流思维,既能灵活组合各种素材,适配不同的视频需求,又加入了变量系统,去解决批量生成、批量测试这些工作流场景。

开发过程中,我一直在思考一个问题:

还需要 UI 吗?

因为同样的功能,Agent 完全可以直接跑了。

迭代到现在,我的答案是:还是得有。

而且,我越来越觉得,AI 时代的产品,应该同时具备三种形态。

第一,是 Web UI。

很多人觉得,有了 Agent,页面就没意义了。

但实际上,页面最大的价值已经不是点按钮了。

一方面,它降低了使用门槛,可视化操作更容易激发灵感,尤其是画布这种东西,很多时候不是你规划出来的,而是拖着拖着就有了新的想法。

另一方面,它更像一个个人 AI 数据中心。

所有生成过的视频、图片、提示词、工作流、变量、历史记录,都沉淀在这里,而不是散落在一个个聊天窗口里。

第二,是 CLI。

我把页面上的所有能力,都做成了 MCP,打包成 cli

除了给页面内置的 Agent 调用之外,本地的 Claude Code、Codex 都可以直接调用。

甚至还能反过来,让本地的 Codex 来操作网页上的画布、节点、工作流。

第三,是飞书。

这是我考虑移动端之后想到的。

怎么才能随时随地用到自己的产品?

App,前期完全没必要。

做移动端网页,体验又很蠢。

最后想到,直接在飞书聊天框里操作不就行了吗?

借鉴了张咋啦用飞书操作 Claude Code 的思路,我直接把页面上的能力全部桥接进去。

以后发一句话,就能生成视频、修改工作流、查询素材、调用 Agent。

飞书本身,就成了移动端。

而这三个入口,其实是互补的。

平时直接找 Agent 干活,最大的缺点就是过程看不到,生成的文件也很乱,过几天自己都找不到。

所以,不管是 CLI,还是飞书,最终所有结果都会回流到 Web UI。

视频、提示词、工作流、运行记录、变量、素材,全都自动沉淀进去。

Web UI 负责沉淀数据。

CLI 负责高效率。

飞书负责随时随地。

三者共用同一套能力、同一套数据。

这下就闭环了。

大家觉得靠谱吗?
01
饼干哥哥
2月前
开源 skill: 一句话把图片转成可编辑pptx
昨天开源了把图片转成 psd 的 skill
我把GPT-image-2生成PSD的能力打包成了Skill,免费开源

评论区就有同学问 ppt可以吗?
可以!
甚至一句话就让 codex 把图片拆成 57 个可编辑节点的 pptx文件(图一)
经过一晚的打磨,现在开源出来了
依然放在 bggg-skills下
github.com

叫 bggg-creator-image2ppt,支持把 png/jpeg 图、以及 html、svg格式的 ppt 图转成 pptx 文件。

逻辑跟 image2psd 类似,同样要用到 codex 的 imagegen 能力,复刻组件图片后,再重新组成可编辑文件, 但对文本框等的识别要好很多。

欢迎 stars 支持👏

这个 skill 对于日常要做分享的人来说非常有用,例如我自己现在ppt页面都是 nano banana 跑的,跑完手动再贴进 pptx文件里, 但要是遇到有问题的、或者要改个标题啥的,就要重跑,很麻烦。

现在有这个skill 后,直接局部改一下就完事了。

问为什么不让 codex 直接生成 pptx呢?
因为这样的想象力大大受限了,只能按以前代码的方式去跑一些固定模板、老套版式

现在等于整个做 ppt 的逻辑都变了,先用image2 放大想象力做漂亮 ppt 页面,再转成 pptx处理细节

感兴趣的都可以去跑一下,目前仅支持 codex里用。

总之,对codex➕imagegen 潜力的开发还在持续。。。
00