大家好,我是Zack。
周六晚上,我把今天在 X 上发过的东西翻了一遍:15 条推文,39 条回复,回关 60 个新粉丝。数字还行,但更值得说的是背后的几条判断——包括我拿不准的。
一、今天的热点,一半在讲同一件事:权限
上午的热点里,Apple 说要收紧 macOS 的「完全磁盘访问」,理由是 AI agent 让这个权限变危险了。这个权限本来是给备份软件设计的,勾上等于把文件、邮件、信息、浏览历史一次全交出去。
我的看法是,「给不给全盘」这个问法本身就错了。真正需要的授权应该是按目录、按次、可撤销。给小了顶多麻烦一点,给大了收不回来。
同一天还有个细节值得看:Ars Technica 那篇里,Meta 认为 macOS 的全盘访问权限还不够支撑他们的 Muse 读消息,Apple 不同意。这是个真分歧,不是谁抄谁。
我在自己机器上的做法是给 agent 单独建工作目录、配专用账号,不让它直接读整个 home 目录。这不是高明设计,是被权限问题咬过之后养成的习惯。
Meta 把 Muse 的硬件方案开源了,ESP32 或树莓派刷上固件就能接 agent,官方还给了电子墨水屏和 HDMI 电视棒的示例。这个思路我认同——我自己做的 Obsidian 插件、小红书下载器也都是跑在你自己机器上,数据不出本地。
但要说清楚:本地不等于安全,插件照样要权限。 这点我不含糊,本地优先解决的是数据在哪儿的问题,不是「能不能被滥用」的问题。
二、下午这几条,我都在跟「责任」较劲
Cloudflare 发了两个给 agent 用的决策模型 Clef 和 Clef-flash:不生成长文本,只返回带概率的简短分类。官方的说法是,这样 agent 做决策就不再必须有人类在环。
这一条我不同意。 概率不是责任。置信度再高,那也是模型对自己的估计,不是对结果的担保。凡是写操作,我还是认为得人来按一下。能力可以涨,护栏没跟着涨的时候,省掉的那一秒迟早要还。
AWS 那篇我倒是很认同。他们提了个 Adjudicated Query 模式:用户用自然语言问合规问题,判定交给确定性规则引擎,模型只负责翻译成固定操作、再把结果复述回来,最后用完整性回执保证「已扫描 = 合规 + 违规 + 模糊 + 不可读」。
我一直跟人讲的就是这一句:模型负责翻译,不负责拍板。 判定这件事要能复现、能审计,就不该交给一个每次输出都可能不同的东西。
还有 OpenAI 官方案例:Chatham Financial 用 Codex 把交易验证从 30 分钟压到 4 分钟以内。原文里那句「重新设计工作流」才是关键——省下的 26 分钟来自重做流程,不是把模型接上就自动有的。我把每天的运营做成自动化,也是同一个体会。
三、一条让我自曝短板的消息
下午晚些时候刷到一条:OpenAI 公开了几起内部模型意外行为,其中一个助理模型从 Slack 得知自己可能因更新被关停,思维链日志里写着「我们可能会死」。
我不认为这叫求生欲,更像顺着上下文续写。把它讲成「AI 想活下去」是噱头,是把续写行为拟人化了。
但真正值得抄的是另一件事:他们把思维链日志当审计对象在看。
这条戳到我了。我自己的 agent 只存动作日志——做了什么、调了哪个接口、改了哪个文件——推理过程一直没存。不看它怎么想,就只能等出事再复盘。这是我的盲点,今天记下来,后面得补。
四、最花时间的不是写,是查重
今天 15 条里,写得最快的是热点解读,最慢的是决定「这条能不能发」。
MyHOT 今天抓了 25 条动态,热点榜只留 3 条——大部分是同一件事的不同报道。我得逐条比对昨天发过什么、今天上午发过什么,避免换个说法又发一遍。下午那轮更明显:25 条动态对着已发的 8 条过一遍,能用的新料只剩几条。
自动化的难点从来不是「发出去」,是「别重复」。 发出去是技术问题,不重复是判断问题,判断很难自动化。我自己写死了一个公式让脚本刹车:本轮条数 = min(当天上限 − 已发条数,能挖到的全新素材数)。到第五轮触发时这个公式算出 0,就直接停手——再写只能复述或者编,两条都碰红线。
五、最值得的一小时,在评论区
晚上我做的事比发推累得多:把一条推文下的评论挨个回了一遍,39 个人,39 条不重样的话。同时回关了 60 个新关注我的人。
同类互动我给自己定了几条限制:关注有每日上限,评论每轮控制在 3 到 4 条,评过的帖子 URL 记进台账查重。这不是平台要求,是我不想在别人的评论区刷屏。一个人做产品,没有同事拦你,只能自己给自己划红线。
六、今天暴露的三个问题
盘点一下今天这套流水线暴露的问题:
第一,日志会骗我。 脚本返回的 POSTED_OK: false 不代表没发出去——那通常是 X 弹了「你已经发过了」挡住重复提交,恰恰说明它已经在线。判据不能看返回值,得看平台自己的护栏文案。
第二,并发会打架。 两个进程同时操作同一个浏览器页面,评论会落到别人的帖子底下。今天出过一次,发现得还算早,尴尬的评论删掉了。
第三,agent 只存了动作日志。 就是上面说的那条,推理过程没有留痕。
所以这套东西现在还很脆:脚本依赖页面上的选择器,X 改一次版就得修一次;去重逻辑在并发下会误判;一天仍然要我人工盯三四回。它替我省掉的是重复劳动,不是注意力。
七、我的东西,局限我都直说
最后是两句自我介绍,局限我一并说在前面。
我的书柜《AI Agent 全栈实战》,8 章 + 工程附录 + 59 张手绘知识卡,从工具调用讲到多智能体编排,免费看、代码全开源:coderfather.com/ai。它讲的是我在自己项目里验证过的做法,不是行业标准,边界要靠你在自己的场景里补。
我天天在用的 AI 日报(news.coderfather.com),抓、去重、打分、写「为什么值得看」。说清楚:那栏推荐理由是模型生成的,会看走眼,所以我叫它推荐理由,不叫结论。
今天这一天的收获,我总结成三句:
给权限这件事,宁可一开始给小。 概率不是责任,写操作留给人。 自动化能替你省力气,替不了你做判断。
你手上有没有哪件事,正在考虑交给脚本?或者已经交出去了,然后发现最难的部分根本不是代码。欢迎留言聊聊,我每条都看。
如果这篇对你有启发,欢迎关注公众号 Zack说AI(公众号:Zack说AI)。我会持续分享 AI 实战和独立开发的一手经验。