/生成式 AI 擅长什么,不擅长什么登录后记录进度

生成式 AI 擅长什么,不擅长什么

建议用时:25 分钟(含练习)

学习目标

能够根据任务的可验证性、风险和上下文要求判断是否适合使用 AI。

本节产出

一张任务适配与风险矩阵

核心知识:先评价任务,再评价回答

“AI 能不能做这件事”不是一个足够具体的问题。同样是写作,给生日卡片想十个开头,与整理带有价格承诺的客户合同,要求完全不同。前者主要看表达是否合适,后者还涉及事实、权限和后果。判断适配度时,应把任务拆成输入、处理、输出和验收四部分,再问每一部分是否具备可靠条件。

生成式 AI 常用于改写、归类、摘要、候选方案和结构化抽取。这些工作存在语言模式,通常能由人提供样例并检查结果。但“通常能辅助”并不等于“每次都正确”。摘要可能遗漏限定条件;归类可能把少数边界样本分错;抽取可能把没有填写的日期补成合理日期。稳定工作流要给未知值保留位置,而不是要求模型填满所有空白。

可以从三个维度做判断。第一是可验证性:你是否有原文、规则、算式或测试来检查输出。第二是错误后果:失败后只是重新写一遍,还是会造成金钱、权益或安全损失。第三是信息充分性:模型是否拿到了完成任务所需的材料,材料是否新鲜、完整且经过授权。

三个维度并不互相替代。一道有标准答案的算式容易验证,但如果结果将直接进入付款流程,仍然需要独立计算和审核。一篇创意文案错误后果较低,但涉及某个组织的真实活动安排时,日期和地点还是应由已确认资料提供。不要因为输出的主体是创意,就免除其中事实部分的检查。

任务先检查材料是否充分,再按可验证性和错误后果分流到直接辅助、增加验证或人工决策

图中的三条出口不是对 AI 能力的永久评价,而是当前任务的处理策略。材料补齐、验证工具增加之后,同一任务可能进入更适合自动化的分支。反过来,原本低风险的草稿一旦要对外发布,也需要重新评估。

把任务拆成模型擅长与工具擅长的部分

假设你要分析一张活动预算表。

模型擅长

让模型解释费用分类、识别说明中的歧义,是语言理解任务。模型可以生成计算步骤,但仍要核对单元格范围、币种和是否重复计入。

工具擅长

汇总金额、计算比例,更适合让电子表格公式或程序完成。使用计算工具提高了运算可靠性,却没有自动解决输入口径问题。

对于实时事实,需要读取可靠的当前资料,并记下时间。对于高影响判断,可以让 AI 整理证据、列出待问问题和比较标准,但不能把它的语言流畅程度当作专业责任的替代。课程里使用的任务评分表只是工作安排工具,并不是医学、法律或财务结论。

案例:把一次社团活动拆成五个小任务

虚构社团准备一场读书交流会。你有一份确认过的活动安排、一张不含个人联系方式的预算表,以及十条匿名反馈。以下安排展示怎样按任务分工。

小任务AI 可以承担的部分验证方法
写宣传文案提供三种表达风格与活动安排核对时间地点
汇总预算解释分类、生成计算方案用表格公式复算总额
整理反馈按主题归类并提取例子检查十条反馈都被覆盖
查询场地政策根据公开页面提取相关条款打开原文并确认生效日期
确定最终支出整理选择依据由有权限的负责人决定

如果 AI 将“部分同学希望延长交流时间”改写成“所有参与者一致要求加时”,问题不是文笔不好,而是量词被扩大了。改进请求应要求每个结论绑定反馈编号,并允许“证据不足”。再让它检查是否存在反例,比简单地说“写得更准确一点”更有效。

另一个常见错误是只抽查看起来正常的输出。假设十条反馈里有九条中文、一条英文,你至少应检查那条语言不同的记录。验证样本应覆盖容易出错的边界,而不是只挑自己最容易理解的项目。

动手练习

  1. 从学习或工作中选五项任务。为每项写出材料来源、输出形式、可验证办法和最严重的合理失败后果。
  2. 选择一项适合辅助的任务,拆出“由模型生成”“由确定性工具处理”“由人确认”三个部分。没有必要时可以缺少其中一部分,但要解释理由。
  3. 故意删掉一条关键输入,观察模型是否承认不知道;再补回输入,比较结果。不要使用真实敏感数据。

参考答案与推演

完成检查

  • 五项任务都包含具体的验证办法,而不只是“人工看一下”。
  • 能解释为什么工具计算正确,仍可能得到业务上错误的总额。
  • 明确标出未知信息,并为高影响动作保留责任人。
  • 至少验证一个边界样例,记录模型在信息不足时的表现。

参考与来源

生成式 AI 擅长什么,不擅长什么

3 道题 · 及格分 60 分

开始测验