AI 智能体替我干了一周的活:5 个真踩过的坑
从「能聊天」到「能干活」,这一轮 AI 智能体是真的变了。我把手上一堆重复工作交出去试了七天,记下 5 个坑。

八月到九月这一个月,AI 圈的密度高得有点不真实:模型一个接一个发,参数竞赛没人聊了,
大家开始问同一个问题——它到底能不能替我把活干了?
我抱着怀疑的态度,把一周里最烦的那部分重复工作交了出去。结论先放前面:能用,但没宣传得那么神。
一、先说结论
| 任务类型 | 实际效果 |
|---|---|
| 格式转换、批量改名、整理表格 | 比我自己做快,基本不出错 |
| 查资料 + 汇总成初稿 | 省一半时间,但必须逐条核对 |
| 需要判断「这件事该不该做」 | 别交,它没有上下文 |
| 跨系统操作(发邮件、改后台) | 权限给放开后风险陡增 |
二、5 个坑
坑 1:你以为的任务边界,和它理解的不是一回事
我说「帮我把这批反馈整理一下」,它整理了,还顺手把语气客气的差评归类成了好评。
问题不在它笨,在于「整理」这两个字对人和对模型根本不是同一件事。
改法:把任务拆成可以验收的动词——提取、去重、按 A 字段分组、输出成三列表格。
坑 2:上下文不是越多越好
一开始我把整个文档都丢进去,结果它抓着一段五年前的背景反复做文章。
后来只喂它必需的那几页,质量反而稳定了。
坑 3:权限一定要最小
让它直接操作后台是最危险的一步。我第一版给了写权限,它很勤快地「顺手」改了三条不该改的数据。
现在改成只读 + 输出草案,我自己点最后那一下。
坑 4:一定要有验收标准
「写得好一点」是没法验收的。换成「不超过 300 字、必须包含三个数据、不出现形容词堆砌」之后,
返工率明显下降。
坑 5:成本要算,时间是省了但不算白省
跑长任务的时候 token 消耗比想象中高。省下的是我的注意力,不是钱,这两笔账得分开算。
三、我的实际用法
现在留在流程里的只有三件事:
- 把杂乱素材整理成结构化初稿
- 把初稿扩写成不同长度的版本
- 把重复的、有明确规则的批处理
其余的都退回到「它出草稿,我做决定」。
写在最后
这一轮和前两年最大的区别,是它开始连着工具一起干活,而不是只吐文字。
但「能自动跑通」和「能放心交给它」中间,隔着的是流程设计和边界划分——
这部分目前还没法外包。
如果你也在试,欢迎在评论里说说你踩的坑。