生成式 AI 擅长什么,不擅长什么
建议用时:25 分钟(含练习)
学习目标
能够根据任务的可验证性、风险和上下文要求判断是否适合使用 AI。
本节产出
一张任务适配与风险矩阵
核心知识:先评价任务,再评价回答
“AI 能不能做这件事”不是一个足够具体的问题。同样是写作,给生日卡片想十个开头,与整理带有价格承诺的客户合同,要求完全不同。前者主要看表达是否合适,后者还涉及事实、权限和后果。判断适配度时,应把任务拆成输入、处理、输出和验收四部分,再问每一部分是否具备可靠条件。
生成式 AI 常用于改写、归类、摘要、候选方案和结构化抽取。这些工作存在语言模式,通常能由人提供样例并检查结果。但“通常能辅助”并不等于“每次都正确”。摘要可能遗漏限定条件;归类可能把少数边界样本分错;抽取可能把没有填写的日期补成合理日期。稳定工作流要给未知值保留位置,而不是要求模型填满所有空白。
可以从三个维度做判断。第一是可验证性:你是否有原文、规则、算式或测试来检查输出。第二是错误后果:失败后只是重新写一遍,还是会造成金钱、权益或安全损失。第三是信息充分性:模型是否拿到了完成任务所需的材料,材料是否新鲜、完整且经过授权。
三个维度并不互相替代。一道有标准答案的算式容易验证,但如果结果将直接进入付款流程,仍然需要独立计算和审核。一篇创意文案错误后果较低,但涉及某个组织的真实活动安排时,日期和地点还是应由已确认资料提供。不要因为输出的主体是创意,就免除其中事实部分的检查。
图中的三条出口不是对 AI 能力的永久评价,而是当前任务的处理策略。材料补齐、验证工具增加之后,同一任务可能进入更适合自动化的分支。反过来,原本低风险的草稿一旦要对外发布,也需要重新评估。
把任务拆成模型擅长与工具擅长的部分
假设你要分析一张活动预算表。
模型擅长
让模型解释费用分类、识别说明中的歧义,是语言理解任务。模型可以生成计算步骤,但仍要核对单元格范围、币种和是否重复计入。
工具擅长
汇总金额、计算比例,更适合让电子表格公式或程序完成。使用计算工具提高了运算可靠性,却没有自动解决输入口径问题。
对于实时事实,需要读取可靠的当前资料,并记下时间。对于高影响判断,可以让 AI 整理证据、列出待问问题和比较标准,但不能把它的语言流畅程度当作专业责任的替代。课程里使用的任务评分表只是工作安排工具,并不是医学、法律或财务结论。
案例:把一次社团活动拆成五个小任务
虚构社团准备一场读书交流会。你有一份确认过的活动安排、一张不含个人联系方式的预算表,以及十条匿名反馈。以下安排展示怎样按任务分工。
| 小任务 | AI 可以承担的部分 | 验证方法 |
|---|---|---|
| 写宣传文案 | 提供三种表达风格 | 与活动安排核对时间地点 |
| 汇总预算 | 解释分类、生成计算方案 | 用表格公式复算总额 |
| 整理反馈 | 按主题归类并提取例子 | 检查十条反馈都被覆盖 |
| 查询场地政策 | 根据公开页面提取相关条款 | 打开原文并确认生效日期 |
| 确定最终支出 | 整理选择依据 | 由有权限的负责人决定 |
如果 AI 将“部分同学希望延长交流时间”改写成“所有参与者一致要求加时”,问题不是文笔不好,而是量词被扩大了。改进请求应要求每个结论绑定反馈编号,并允许“证据不足”。再让它检查是否存在反例,比简单地说“写得更准确一点”更有效。
另一个常见错误是只抽查看起来正常的输出。假设十条反馈里有九条中文、一条英文,你至少应检查那条语言不同的记录。验证样本应覆盖容易出错的边界,而不是只挑自己最容易理解的项目。
动手练习
- 从学习或工作中选五项任务。为每项写出材料来源、输出形式、可验证办法和最严重的合理失败后果。
- 选择一项适合辅助的任务,拆出“由模型生成”“由确定性工具处理”“由人确认”三个部分。没有必要时可以缺少其中一部分,但要解释理由。
- 故意删掉一条关键输入,观察模型是否承认不知道;再补回输入,比较结果。不要使用真实敏感数据。
参考答案与推演
例如“整理匿名读书反馈”可以交给模型初步归类,用编号对照表检查是否遗漏,再由活动负责人决定是否改变流程。缺少活动日期时,正确输出应保留待确认字段,或提出明确问题;不应凭常见活动安排自动填一个周六下午。
若你选择“计算预算”,答案应把计算规则和业务口径分开:程序可以把十个数字相加,但是否需要扣除已经退款的款项必须由输入规则说明。完成后的适配表不应只写“适合、不适合”,而要写“在什么条件下适合,以及失败时在哪里停下”。
完成检查
- 五项任务都包含具体的验证办法,而不只是“人工看一下”。
- 能解释为什么工具计算正确,仍可能得到业务上错误的总额。
- 明确标出未知信息,并为高影响动作保留责任人。
- 至少验证一个边界样例,记录模型在信息不足时的表现。
参考与来源
- NIST:AI Risk Management Framework:了解按情境管理 AI 风险的基本框架。
- Anthropic:Building effective agents:比较不同复杂度任务所需的系统结构。
生成式 AI 擅长什么,不擅长什么
3 道题 · 及格分 60 分