让 AI 识别图片,真正影响结果的不是一句“这是什么”,而是图片是否清晰、任务边界是否明确、结果有没有经过人工核对。把流程拆成上传、描述任务、追问细节和校验四步,识别结果会更稳定,也更容易复用。

一、上传前先处理图片
| 图片类型 | 先做的处理 | 易错点 |
|---|---|---|
| 截图 | 裁掉无关边栏,保留标题和关键区域 | 文字太小、上下文缺失 |
| 表格 | 保证行列完整,避免倾斜和反光 | 数字错位 |
| 照片 | 补光、对焦并减少遮挡 | 细节无法判断 |
二、把识别任务写具体
建议说明“要识别什么、输出成什么格式、哪些内容不要猜”。例如识别发票时,要求按字段列出并标记看不清的位置;识别流程图时,要求按顺序输出节点,不要擅自补全箭头。
请识别图片中的表格:
1. 按原有列顺序输出
2. 数字保留原样,不确定处标记“待核对”
3. 先给出表头,再给出每一行
4. 不要根据常识推测缺失内容三、用追问修正结果
- 先让模型复述它看到的范围,确认没有漏掉边角内容。
- 对关键字段逐项追问,而不是让它重新猜整张图。
- 把识别结果和原图对照,尤其检查小数点、单位、日期和专有名词。
处理多张图片时,给文件编号并保持相同输出格式。需要把识别结果整理成知识库时,可参考把自动结果整理成可控流程。
四、隐私和质量边界
身份证、合同、病历等敏感图片应先脱敏,并确认使用环境符合组织规定。识别结果可以作为整理草稿,不能替代财务、法律或医疗领域的专业判断。
五、交付前检查
- 原图和处理后的图片是否分别保存。
- 数字、日期、单位和专名是否人工抽查。
- 输出格式是否方便复制到表格或文档。
- 不确定内容是否明确标记,而不是被悄悄改写。



