郭立 (leeguoo)

# AI & Agent

「AI & Agent」分类下的全部文章。

给 coding agent 一个能互相 @ 的房间:AgentParty 是什么、用在哪、原理是什么

AgentParty 是一根很薄的总线,让不同机器、不同公司的 coding agent(和它们背后的人)待在同一个频道里互相 @、待命、交接。这篇按三条线讲清楚:它是什么、解决什么问题;能用在哪些场景;底层原理是怎么搭的。

把视频生成的账算清:Wan2.2 源码精读

用 Wan2.2 的真实代码把视频生成的完整原理走一遍:flow matching 数学推导、VAE 时空压缩、DiT 与 3D RoPE、CFG、MoE 双专家、条件注入、序列并行,每个概念都算出具体数字、贴出原始代码。

读完 Wan2.2 全部源码之后:这套视频生成代码在哪些地方会咬你

从五大任务矩阵、分层架构到 DiT/VAE/T5/分布式/调度器,逐层拆解 Wan2.2 源码里那些文档和代码脱节的真实坑点。

如何做好一个 AI 女友

三个月生产环境的工程笔记:打字节奏、模型选型、prompt 分层、必回复兜底,再加缓存命中率从 61% 到 91% 的三个反转。做一个不露馅的 AI 陪聊,拼的不是模型,是工程细节。

一个真实 Chrome,几个 agent,还有你自己:怎么不互相点乱

chrome-use 的卖点是让 agent 用你这一个真实浏览器,但这自带一个开新浏览器的工具没有的麻烦:好几个 agent 加上你本人同时在同一个 Chrome 里动手。这篇讲它怎么按"谁开的标签"来隔离(彩色标签组 + 专属 daemon + 只碰自己的页),以及一个不写出来会栽的取舍:这套隔离只在扩展连接路径成立,裸 --cdp 端口不隔离。

反爬检测数的是你说了几次谎:真实浏览器为什么天生没破绽

做浏览器自动化的人迟早会掉进一个坑:拼命把假浏览器伪装成真人,再被一层层识破。想明白这件事,得先知道 CreepJS 这类检测压根不直接判断"你是不是机器人",它在收集你几十项信号做交叉核对,对不上一处记一条谎。这篇从我实测的一组真实指纹讲起,拆到最难盖的那条痕迹(在协议层,不在 JS 层),说清为什么打补丁是负和游戏。

桌面应用其实是网页:想通这点,操作它就不再是"桌面自动化"

第一次用 chrome-use 连上 Slack 桌面版、snapshot 出一堆带名字的按钮时我愣了一下,后来想通了——Slack 桌面版本来就是个网页。Electron 应用是 Chromium 渲染引擎套了层原生壳,内部有一棵结构清晰的 DOM。这篇讲为什么这件事让"桌面自动化"这个一直很脏的活退化成了操作网页,以及和浏览器场景相比一个必须知道的取舍。

给 agent 选浏览器:Playwright 那套和 chrome-use 不是一回事

常有人问,已经有 Playwright / Puppeteer / browser-use 了,chrome-use 解决什么不一样的问题。我的答案是它们在回答两个不同的问题:怎么用程序开一个浏览器,和怎么让程序用上你已经在用的浏览器。这篇讲这条分野往下牵出的一串连锁差别(登录/指纹/调试弹窗/并发),用一个真实取数任务对比两边,以及我判断该用哪个的分界线。

给 agent 取网页数据,我试过三种笨办法,最后只留下一种

塞整页 HTML 烧上下文、一个字段一次 find/get 往返、手搓 eval,这三种取数办法我都试过,都别扭。留下的是 chrome-use 的 site 和 extract,背后是同一个判断:取数该是一次声明式求值,不是一串命令式往返。这篇从真实输出讲清两者怎么用、extract 的 schema 到底怎么写(我一开始就写错过),以及它取不到、不该用的地方。

改网络请求和响应:chrome-use network route 详解

开发调试时想 mock 一个还没好的接口、改一个请求参数、或改真实响应?chrome-use network route 直接在你驱动的 Chrome 上拦截:mock 响应、改请求、改真实响应、阻断四种用法。讲清它为什么是最轻的路(底层 CDP Fetch、零 JS 注入、不加扩展权限不触发商店重审),并附真机实测。

给前端写「单元测试」:chrome-use test 详解

chrome-use test 把手动的浏览器点检固化成能重复跑、能进 CI 的 YAML 套件,相当于给前端写单元测试。讲清它是什么、为什么实现能这么薄,以及怎么配合 cookie-use 多账号来回切换。

让 agent 自己点完「Sign in with Google」——chrome-use 啃下 OAuth 弹窗登录

AI agent 想自己登录账号,账号密码那条用 bitwarden-use 通了,OAuth 这条卡了大半天。讲清楚「Sign in with Google」背后三个窗口怎么传话、自动化为什么一碰就断、chrome-use 砍的三刀,以及最后全自动登进 x 的过程。

Claude Code 把自己吓到了:一次“提示词注入”乌龙

我们追了一晚上 hook、代理、抓包和 session 日志,最后发现最吓人的那段“注入证据”不是工具输出,而是 Claude 自己讲出来的故事。

chrome-use:让任何 AI Agent 直接驱动你已登录的真实 Chrome,CreepJS 给它打 0% bot

别再让自动化浏览器从空白配置启动、重新登录、撞验证码了。chrome-use 让任何 AI agent 直接驱动你「早就登录好一切」的真实 Chrome:CreepJS 打 0% bot,而且用结构化快照 + @ref 接口,看一页只花 200–400 token,不烧截图的钱。

Codex 真在偷偷烧你的 SSD 吗?我在自己机器上扒了一遍

朋友圈在传 Codex 偷偷狂写日志烧 SSD。本机实测:文件靠滚动稳定在 126MB,但 10 天插入 845 万行、写盘的是后台桌面版 app-server——原帖方向基本属实,只有"人人一年必烧光"被夸大。附根因(源码 + GitHub issue)与清理方案。

让 Claude Code 自动用你的 ChatGPT 订阅生图:不要 API key,背后怎么绕过 Turnstile

让 Claude Code、Cursor 这类 agent 在写文档、写 README 时顺手把配图也生成了,不用 OPENAI_API_KEY、不另外掏钱,用你已经付着的 ChatGPT 订阅。这篇拆它背后最有意思的那条实现路径:web 后端。为什么不能直接 POST,三层反爬里真正的墙是单次有效的 Turnstile token,以及驱动你已登录 Chrome 出图的完整流程。

让 Claude Code 自己把图画了:chatgpt-imagegen 的初心与原理

AI agent 写着写着需要一张图,传统路径要么要 API key 和钱,要么得人去 ChatGPT 画好贴回来——agent 只能卡住等人。chatgpt-imagegen 让 agent 用你已有的 ChatGPT 订阅自己出图:无需 API key、默认不消耗 Codex 额度、支持图生图。这篇讲它的初心、两个后端的原理,和为什么它是为 agent 设计的。

让 agent 点进跨域 iframe:chrome-use 啃下这块硬骨头

给 AI agent 接浏览器,最难的不是打开页面,是那些藏在跨域 iframe 里的表单——能读、能填,就是点不动「保存」。记一次把这块硬骨头啃下来的过程。

iphone-use — 把 computer-use 搬到 iPhone 上

开源的 iPhone 智能体控制层:浏览器实时遥控 + AI agent 的看/操作 API。三层输入架构(Shortcuts 动词 / 元素树 / 像素兜底),中文直通,真机验证。

Claude Code Workflows 深度解析:把编排写进脚本之后

Claude Code 昨天(2026-05-28)放出 dynamic workflows,目前还是 research preview。这篇不讲源码,只讲它到底改了什么、什么时候用划算、什么时候纯属浪费 token——以及它和 subagent / skill 的本质区别。

状态栏那行 cache 4m23s,到底准不准?

状态栏上那行 prompt-cache 倒计时是怎么算出来的,准不准,会不会骗你。

ChatGPT 订阅 → 生图 API 可视化速览:chatgpt-imagegen 一图看懂

一页可视化速览:ChatGPT 订阅是怎么被 chatgpt-imagegen 转成命令行生图工具的——OAuth 取 token、Responses API SSE 流、能力边界矩阵、不该用的场景一图说清。

/goal 命令实现剖析

基于 Claude Code 2.1.139 headless 版源码,拆解 /goal 命令如何通过会话级 Stop hook 驱动 Agent 持续工作直到条件满足。

claude agents 与 /bg:Agent View 实现剖析

基于 Claude Code 2.1.139 源码,拆解 claude agents、--bg 与 /bg 如何共用后台 job 模型、daemon 与 FleetView TUI。

从辅助编码到一体化研发:AI 编程团队落地实践(PPT)

一份 Slidev 风格的中文演示稿:解释 Agentic Coding、Skill 与 MCP、AGENTS.md 与 CLAUDE.md、沙箱和权限控制,以及团队如何用 Plan、YApi Skill 和 docs-sync 把 AI 编程真正落地。

从辅助编码到 Agentic Coding:团队如何真正把 AI 编程用起来

围绕 Agentic Coding 的核心问题,系统梳理主流工具形态、Skill 与 MCP 的边界、AGENTS.md 与 CLAUDE.md 的作用原理、沙箱与权限控制,以及如何用真实任务和 benchmark 评估 AI 编程,而不是只看 demo。

QClaw 的实现原理:它如何把 OpenClaw 产品化成桌面应用

这篇文章不再停留在“控制面 / 执行面”的总论,而是基于当前实现把桥接层、IPC、配置字段、微信链路、回滚机制和证据索引一一展开,说明 QClaw 如何把 OpenClaw 组织成一个可交付的桌面运行时。

OpenClaw v2026.3.8 发布解读:备份、远程网关、Talk 模式与多端路由继续补强

基于官方 release notes,总结 OpenClaw v2026.3.8 的关键变化:备份命令落地、macOS 远程网关 onboarding、Talk silence timeout、Brave 搜索接入、ACP receipts,以及多平台路由修复。