一份八十页的合同草案、一套产品需求文档、一份行业研究报告,落到一人公司手里,往往不是"没时间读",而是"读了也记不住、找不回来"。AI 在这里能帮的忙很具体:把非结构化文本变成可检索、可定位、可复核的结构。但它帮不上的是替你承担责任——凡是最终要签字、要交付、要对客户负责的判断,仍然只能由人做出。下面以一份合同草案的审阅任务为例,把整个流程拆成文件清理、问题清单、分段处理、引用核对四个阶段,并说明哪些内容不该直接交给 AI。

阶段零:先划出不能进 AI 的内容
在打开任何工具之前,先做一次信息分流。这一步比后面的提示词技巧重要得多,因为一旦敏感内容进入了不该进入的地方,后面所有流程都只是补救。
建议把文档内容分成三类处理:
- 可以直接处理:公开的产品资料、已发布的研究报告、通用条款模板、你自己撰写的草稿。
- 脱敏后处理:含有真实姓名、身份证号、银行账号、联系方式、报价数字、未公开财务数据的段落。做法是替换成占位符再送进去,例如把甲方名称统一替换为"甲方 A"、金额统一替换为"金额 X",并单独保存一份对照表,只放在本地。
- 完全不进 AI:涉及商业秘密的核心算法与配方细节、未签署的独家条款原文、客户明确要求不得外传的资料、以及任何你所在行业有明确保密义务的内容。
判断标准可以简化成一句话:这段文字如果出现在第三方服务器上,你是否能向客户解释清楚。 答不上来,就不送。此外,上传前确认所用工具的数据使用条款——是否用于模型训练、保留多久、能否关闭,这些通常在工具的隐私设置里可以查到,各家差异较大,不要凭印象假设。
阶段一:文件清理与素材归位
AI 处理长文档效果差,八成不是模型的问题,而是输入太脏。清理阶段要做四件事:
- 统一格式。扫描件先做 OCR,PDF 转成纯文本或 Markdown,去掉页眉页脚、水印和重复的分页标记。保留页码信息,后面核对要用。
- 恢复结构。把标题层级、条款编号、附件边界标出来。一份合同如果条款编号丢失,AI 会把"第 3.2 条"和"第 3.3 条"混成一团。
- 拆分文件。按章节或按主题拆成若干份,每份控制在你能一口气读完的长度。拆分点选在自然边界,比如"定义条款 / 权利义务 / 付款与交付 / 违约与终止 / 附件"。
- 建立主控表。用一张表格记录每份子文件对应的原始位置,例如文件名、原文档页码区间、拆出的日期。这张表是后面引用核对的唯一依据。
命名规则建议固定成"项目名_文档类型_版本_日期_章节",避免出现"最终版_v3_真的最终.docx"这种局面。
阶段二:先写问题清单,再让 AI 读文档
很多人上来就让 AI"总结这份合同"。总结出来的东西通常正确但无用,因为它不知道你在担心什么。更有效的顺序是反过来的:先列出你要回答的问题,再让 AI 带着问题去读。
问题清单按角色来列,比如:
- 交付物具体是什么,验收标准由谁判定;
- 付款节点与我的现金流是否匹配,有没有账期过长的条款;
- 知识产权归属如何约定,我保留了什么权利;
- 终止条件是什么,提前终止需要承担什么成本;
- 有哪些条款把责任上限写得过高或过低。
把这份清单直接写进提示词,并要求 AI 逐条回答、标注原文位置。示例结构如下:
你是一名文档分析助手。以下是文档的第 3 部分(页码 21-35)。
请只回答我列出的 5 个问题,每题输出三项:
1)文档中与之相关的原文片段(必须逐字引用,并标出页码);
2)你的理解,用一句话说明;
3)你不确定或文档未提及的地方,明确写"文档未说明"。
不要补充文档中没有的信息,不要给出建议或结论。
最后两条约束是关键。"不要补充文档中没有的信息"能显著降低模型替你脑补条款的概率;"不要给出建议或结论"则把判断权留在了你手上。整份文档不要一次性丢进去,按阶段一拆好的子文件分批处理,每批单独提问,最后再合并。

阶段三:分段处理与结构化摘要
分批处理时,每个片段的输出都要能拼回整体。所以要求 AI 用统一格式输出,而不是自由发挥。一个可用的摘要模板包含四栏:
| 字段 | 内容要求 | 用途 |
|---|---|---|
| 主题 | 这一段在讲什么,一句话 | 快速定位 |
| 关键条款/数据 | 逐字引用,带页码 | 后续核对 |
| 与我问题的关系 | 对应问题清单第几条 | 建立索引 |
| 不确定项 | 表述模糊、指代不明、前后冲突之处 | 优先人工看 |
处理顺序上,先跑一遍"问题清单",再跑一遍"通读摘要",两遍结果交叉对照。如果时间有限,只做前者也够用——带着问题读永远比无目的通读更有效率。
有一个容易被忽略的点:重叠区。相邻片段之间保留一小段重叠内容(比如前后各留两三段),可以避免条款在切割处被截断,代价只是多处理一点点文本。
阶段四:引用核对,这一步不能省
到这里,你手上有一堆 AI 给出的条目。它们看起来条理清晰,但每一条都是待验证的假设。核对流程建议这样走:
第一步,逐条回原文。 按主控表定位到页码,找到原文,核对三件事:引用是否逐字一致、页码是否指向正确位置、理解是否偏离原意。凡是找不到原文出处的条目,直接作废,不要"根据上下文推断它应该在"。
第二步,标记状态。 给每条结论打三种标签之一:已核对(原文支持)、存疑(表述模糊或前后不一致)、不成立(原文没有或与原文相反)。存疑项汇总成一份短清单,这才是真正需要你花时间判断的部分。
第三步,抽样复查。 当文档很长、条目很多时,可以按比例抽查,比如随机抽二十条重新核对一遍。如果抽查发现错误率明显偏高,说明前面的分段方式或提示词有问题,整批结果都要重跑,而不是只修那几条。
第四步,人工定稿。 最终写进交付物、邮件或决策记录的每一条结论,都应该是你自己在原文里看过并且同意的。AI 的输出在这条链条上只是"线索生成器",不是"事实来源"。
需要说明的是,涉及权利义务、责任划分、合规义务的内容,最终判断应当交给有执业资格的律师或专业人士。本文描述的是文档整理的工作流,不构成任何法律意见。

把四个阶段固化成可复用的检查表
单人经营最缺的是时间,最怕的是返工。把上面这套流程做成一张清单,下次处理新文档时照着走,能省掉大量临场决策:
- 上传前:确认保密级别,完成替换与对照表备份;
- 清理时:格式统一、结构恢复、按自然边界拆分、主控表建立;
- 提问前:写问题清单,规定引用格式与"不知道就说不知道";
- 处理中:分段进行,保留重叠区,统一输出模板;
- 交付前:逐条回原文,标记状态,抽样复查,人工定稿。
工具选择上,优先级大致是:能关闭训练授权 > 支持长上下文 > 支持本地或可自控存储 > 输出格式稳定。价格和功能各家迭代很快,与其追着版本比参数,不如把上面这套流程跑顺——流程稳定之后,换工具的迁移成本很低,而流程不稳,换多少次工具都还是从头返工。





















暂无评论内容