Knowledge

先试错再铺开:AI 批量任务的返工控制节奏

先试错再铺开:AI 批量任务的返工控制节奏

封面图:先试错再铺开——小批量验证质量,纵向跑完每个输入

对一批同类输入(100 个文件、多个模块、多段文案)用同一套 AI 流程时,最常见的两种”大批量”做法——一次性全量、横向铺步骤——都会在流程缺陷暴露时放大损失。本文给出”先单点试错、再纵向铺开”的节奏,把返工爆炸半径压到单个输入,并说明横向提效的启动前提。

为什么”大批量”做法会放大损失

反模式 A——一次性全量:直接把 100 个文件丢给 AI 跑完整流程。第 30 个文件格式特殊、流程中断——前面 29 个已跑完,但质量未验收,可能全要重来。你付了 100 份的 cost,只确认了流程”能跑”,没确认”跑得好”。

反模式 B——横向铺步骤(齐步走):所有输入先统一做第 1 步、再做第 2 步……一旦输入 #7 在第 2 步暴露问题(依赖缺失/格式不对),#1~#100 的第 1 步都已执行,这些产出可能因 #7 的共性缺陷全部作废。一步出错,全盘返工。

两种做法的共同本质:在流程被验证之前,就投入了全部成本。

三种铺开节奏的取舍

方案 优点 缺点 适合
一次性全量 看起来最快 中途崩则全废、先付全量 cost 输入同质且流程已验证
横向铺步骤(齐步走) 便于复用中间结果 一步出错全体返工 流程极稳、输入同质
先试错 + 纵向铺开 返工爆炸半径最小 前期多花一次试错 输入多样、流程未完全稳定
✅ 纵向:输入1[步1→步2→步3 完成] → 输入2[…] → 输入3[…]
❌ 横向:所有输入步1 → 所有输入步2 → 所有输入步3

对还没跑稳的流程,”先试错 + 纵向”几乎总是更省——一次试错挡住 N 次返工

核心节奏:三个动作

  1. 单点试错(Pilot):挑 1 个最典型的输入,完整跑一遍全流程,人眼验收质量(对照验收断言清单),OK 才铺开。
  2. 纵向铺开(per-input):每个输入独立跑完”步1→步2→步3”再看下一个。核心性质是故障隔离——某输入出错只影响它自己。
  3. 横向例外:仅当批量跑过几轮、流程被断言锁死、输入同质,才值得横向提效;不默认横向。

三条设计规则:

  1. 先试错再铺开——拿 1 个代表性输入完整跑完、人眼验收,确认 OK 才铺开。
  2. 纵向独立推进——每个输入独立跑完整流程,某输入出错只影响它自己。
  3. 稳定是横向的前提——被断言锁死 + 输入同质,才用横向提效。

这个节奏不是 AI 时代的新发明

它一直是工程与组织验证过的推广方式,AI 只是让它重新变成刚需:

生成得越快,错得也越快;铺得越大,一次流程缺陷的账单就越大。试点先行,从来不是慢,而是最省的快。

实操:把”跑对了”变成能勾选的断言清单

纵向节奏能不能守住,不靠意志力,靠把”跑对了”翻译成一条条可勾选的断言:

格式/结构类断言能用 diffjq 这类命令脚本化,事实类保留人眼复核——这正是”跑了”和”跑对了”之间的那道闸。

# ✅ 纵向:一个跑完、验收过了,才轮到下一个
for input in batch/*; do
  run_pipeline "$input"              # 步1→步2→步3 一次跑完
  if ! run_assertions "$input"; then # 对照上面的断言清单
    echo "FAIL: $input → 只修它、重跑它,不牵连已完成的部分"
    break
  fi
done

一句话原则:验收不是”跑完了”,是”跑对了”。等连续几轮断言全过、输入同质,再写批量脚本也不迟;在那之前,1 份试错的成本永远小于 N 份返工。

效果与可追踪指标

可追踪指标:铺开过程中因流程缺陷返工/作废的输入数。横向/全量往往是 N 个,纵向通常被压到 1 个试错样本内。发布后可额外记录”试错样本与全量样本的验收通过率对比”,确认试错确实挡住了共性问题。

落地清单

总结与延伸阅读

下次要批量跑一批文件前,先挑最刁钻的那一个单独跑一遍,对照断言清单验收——过了再铺,返工成本会小得多。本篇是「AI 高性价比使用策略」系列的一篇,更多工程实践文章见站点知识库。

📖 Read in English

← Back to all articles