AI 办公提效场景扩展
第 12 章
12 / 23AI 多模态输入与解析
用截图/文件/图片驱动任务,AI 解析减少手抄与搬运
本章实践目标
01要解决的工作问题
用截图/文件/图片驱动任务,AI 解析减少手抄与搬运
02完成后带走
一份能用于真实工作的模板,包含真实输入、明确输出格式和人工复核点。
03做到什么算完成
用真实任务跑通一次,核对关键事实,并记录使用前后的时间。
办公场景中,大量信息藏在纸质合同、白板草图、报表截图里。AI 的多模态能力(Vision)如果只用来做 OCR(文字识别)就太浪费了。它的核心价值是:读懂视觉背后的逻辑。
1) 白板草图:从“照片”到“可运行架构”
开会时在白板上随手画的业务流程,以前需要人肉整理成文档。现在,你可以直接把照片喂给 AI。
🚀 实战技巧:视觉逻辑转化
拍一张手绘流程图:
专家版 Prompt:
你是系统架构师。请分析这张白板照片。
任务:
1. 识别出图中所有的【业务角色】(矩形)和【决策节点】(菱形)。
2. 将这个流程转化成 Mermaid Flowchart 代码(你可以直接在 GitHub/Notion 渲染)。
3. 逻辑诊断:基于你的理解,这个流程是否存在“死循环”或“缺少异常处理”的情况?
请以“架构图代码 -> 逻辑说明 -> 改进建议”格式输出。
2) 复杂报表解析:干掉“人肉搬运”
面对一张 PDF 或网页截图里的复杂表格,手动录入 Excel 极易出错。
💡 场景模拟:对比三份供应商报价单截图
提升 Prompt:
这是一张包含 15 行、8 列的复杂报表截图。
任务:
1. 请提取图中所有的数字,并以 Markdown 表格形式还原。
2. 校验逻辑:请横向计算每一行的“单价 x 数量”是否等于“总价”。如果不等于,请在表格中用红色(或加粗)标注。
3. 深度分析:这几份报价中,单价波动最大的是哪一项?
注意:如果你对某个数字不确定(如由于水印遮挡),请输出 [?] 而不要编造。
3) 截图驱动的任务:把视觉变成“Prompt 语料”
当你看到一个很棒的网页设计或文档模板时,可以直接“截给”AI。
实战示例:
- 文案模仿:截一张竞品的爆款海报。“请分析这张海报的视觉重心和文案排版逻辑,并为我的新功能写一个类似的草案。”
- UI 还原:截一张后台管理界面的图。“请根据这个截图的布局,用 React + Tailwind CSS 写出它的静态前端代码。”
4) 避坑指南:眼睛也会骗人
| 风险点 | 表现 | 解决方案 |
|---|---|---|
| 数字幻觉 | 对于 0 和 8,或 1 和 l,视觉模型有时会看错 | 关键数据必须要求 AI 进行“自洽性校验”(如总计求和)。 |
| 隐私泄漏 | 截图角落可能包含浏览器书签、系统通知等隐私 | 截图前开启隐私模式,或使用局部截图,不要截全屏。 |
| 空间感缺失 | AI 对图中元素的“相对位置”描述有时不准 | 如果涉及精密设计,建议配合文字描述辅助。 |
5) 动手练习
任务:找一张你工作中遇到过的最复杂的 Excel 截图。
- 让 AI 将其转化为 Markdown 格式。
- 要求它:基于这些数据,生成 3 条具有洞察力的结论。
- 让它:为你推荐一个最适合展示这些数据的图表类型(饼图、柱状图还是漏斗图?)。
6) 完整案例:从报价截图到采购比较表
假设你收到三家供应商的报价截图。目标不是让 AI “选最便宜的”,而是先建立可核对的数据层。
第一步:逐份提取,不急着比较
请只处理当前这一张报价截图。
按“原文值 / 标准化值 / 页码或区域 / 置信说明”输出:
- 项目名称
- 数量与单位
- 单价
- 税费
- 总价
- 有效期
看不清的字符写 [?],不要猜。
第二步:人工抽查关键字段
金额、日期、数量和合同条款至少回看原图一次。可以用下面的抽查规则:
| 字段 | 为什么高风险 | 怎么核对 |
|---|---|---|
| 总价与税费 | 小数点或税率错误会改变决策 | 重新计算并与原图交叉确认 |
| 数量与单位 | 件、箱、小时可能被混淆 | 同时保留原文单位和标准单位 |
| 有效期 | 影响实际采购时间 | 记录原文日期,不自行推断时区 |
| 排除项 | 低价可能因为少了服务 | 单独列出“不包含什么” |
第三步:基于已确认数据比较
以下字段已经人工确认。
请输出:
1. 可直接比较的项目
2. 因范围不同不能直接比较的项目
3. 需要向供应商追问的问题
4. 不做推荐,只列出价格、范围、风险和信息缺口
7) 多模态输入清理清单
- 裁掉浏览器标签、聊天通知、客户姓名等无关信息
- 每次上传前确认文件是否允许进入所用 AI 服务
- 扫描件保留页码,长文档要求答案引用页码或区域
- 对金额、日期、身份、签字和合同条款安排人工核对
- 保存原文件和结构化结果,避免结果脱离来源
8) 常见失败与修正
| 失败表现 | 原因 | 修正 |
|---|---|---|
| 表格看起来完整但数字错 | 模型会补齐模糊单元格 | 强制输出不确定标记,并抽查关键列 |
| 长 PDF 漏掉附件 | 一次输入范围过大 | 按章节或页段处理,再做合并总结 |
| 图表结论过度 | 只看视觉趋势,没有原始数值 | 要求列出结论对应的数据点和限制 |
| 截图泄露隐私 | 上传前没有裁剪和脱敏 | 建立“裁剪—脱敏—权限确认”固定步骤 |
9) 本章交付物
完成一份 可追溯的多模态提取包:原文件、字段表、不确定项、人工抽查记录和最终结论。涉及敏感材料时,继续学习 AI 安全与伦理。