一页看懂:标题大纲 与 手册原文入口
先明白字节为什么收材料,再按优先级明确合作条件,然后看各档材料要求;最后附上内部执行安排。必须确认、涉及时确认、可选确认分开展示。
docx/FZOgd8…TnnQd ↗
L2 · 再做成题目考卷+标准答案,量产主力docx/P9AgdA…cZnkf ↗
L3 · 搭查询环境只读的模拟查询环境docx/UrVVdd…nVg ↗
wiki/Iq8pwJ…aonrp ↗
第3页:必须确认 · 第4页:涉及时必须确认 · 第5页:可选确认。优先级为内部安排,非字节新增要求。
总览与挑活 · L1 交什么 · L2 出卷与硬规矩 · L3 查询环境与脱敏 · L4 写工具 · 共同红线(第16页)
怎么看这份稿:导览(本页)→ 目的(第2页)→ 确认清单(第3–5页)→ 材料要求(第6–16页)→ 内部安排(第17–18页)。
本页性质:四个链接指向官方手册原文;模块说明是对本稿结构的概括,非手册内容。
把企业里的真实工作,
变成智能体能反复练习的题目和环境
通俗地说:收集企业真实、复杂、模型还容易做错的活,
让智能体学会按业务规则把活做对,并能检验它到底做得怎么样。
这件活平时怎么干?
哪些地方要拿主意?
做错会有什么后果?
真人怎么做、模型错在哪,
都留下来;配上评分标准,
才知道智能体有没有进步。
把相关数据和查询工具
做成固定的练习环境,
每次都能复现同样的结果。
在能还原的环境里练写操作;
该执行时执行,该拒绝时拒绝,
训练时不真的向外部发起操作。
按优先级推进:第 3 页必须确认 → 第 4 页涉及时确认 → 第 5 页可选确认;材料要求见第 6–16 页,内部安排见第 17–18 页。
目的概括,非逐字引述:L1 开头;L2 第三、五节;L3 开头;L4 第一、四、七、八节。
本稿引号内为原文;其余为摘要。确认清单和行动安排单独标注,不能当作手册新增要求。
必须先确认:数据边界与合作条件
以下优先级是我们的内部安排。按各项时点确认后再进行对应操作;不影响先读手册、跑样例,不要求等第 5 页的可选项全部答完。
已知依据:L1 第6步及 L2 介绍节;L2 第五节;L3 第十节;L4 第九节。
边界:具体商务及数据流转安排在四册正文中未完整写明;先查已有协议与样例材料,再补问缺项。必须确认的分级属于内部判断。
涉及时必须确认:模型、验收与交付口径
按你实际做的档位和情形选项;触发了就先确认,再做该项。未涉及的项目不阻断当前档位;手册已明确的规则继续执行。
已知依据:L1 开头、第2步及 L2 介绍节;L2 第一、五节;L3 第八、九、十二节;L4 第六、九节。
内部判断:仅暂停触发项对应的操作。L2 材料清单已有答案,不再把三样 / 四样的概括差异作为等待开工的理由。
可选确认:有需要再问,不额外卡开工
以下是实施支持与额外合作诉求,不是每个项目都要先得到答复。可选的是补问,不是手册要求;已发现不合规或执行不通时,必须先解决对应问题。
L2 交付:评分表、真人底稿、模型错题、文件清单;开放任务再交第二份思路不同的真人答案。模型信息按模板记录。
授权与脱敏:授权用途写“用于模型训练”;L2–L4 要求客户盖章,L4 额外覆盖 dry_run 写操作录制。L3/L4 在客户侧脱敏,对照表留给客户;关联一致、映射稳定、日期统一偏移、枚举和状态码不变,前后差分通过率相同。
已知依据:L1 开头及红线后提示;L2 开头、第一、四、五节;L3 第四、十、十一节;L4 第九节。
内部安排:可选确认的分级不改变任何验收要求;无指定方案不等于已通过验收。
四档的区别,是交付内容
内容逐档递进;目录按对应手册重组,不能直接把低档目录原样叠加。
去客户现场问清工作流、判断点和做错的后果;一个客户场景只交一条 L1、一道例题。不要求评分标准,也不要求搭系统。
补评分表、真人底稿、模型失败原话、文件清单。真人底稿证明“这件活真人是能干对的”;失败样本证明“这件活模型现在还干不好”。
数据快照、工具说明与代码、真实查询录制和差分测试,支持“让我们不在你身边的时候也能查到同样的数据、跑出同样的结果”。
在 L3 基础上增加能写的工具和写操作拒绝规则清单;补写操作样本、演练、回滚与授权范围。
执行按 L2 自册的具体文件清单;L1 介绍的三样未列文件清单,不再把概括数量差异当作开工阻断项。
来源:L1「你要交的是什么」「这个场景还想多交几道题怎么办」;L2 开头、第一、三、五节;L3 开头、第一节;L4 第一节。
L1 的条件,不能混成 L2 的门槛
原文:“真实的复杂工作一般 6~15 步。只有两三步的,交上来大概率算低价值场景。”
至少 2 步需要判断;做错有后果。模型失败率和真人评分不是 L1 的要求。
老师傅要翻好几个地方才能下结论;模型跑 3 次,至少 2 次答错;真人按评分表能拿到 80 分以上。真人拿不到 80 分,先检查任务是否说清、评分是否过严。
跨系统查证,有版本冲突或干扰信息。原文:“至少调了三个以上的工具函数、跨了两张以上的表”。仅靠文件就能完成的是 L2。公开查询服务也可属 L3,按第九节处理。
单看一份材料会错;需判断哪版规则有效;存在确实见过模型或新人踩中的误导信息。
只查询、判断、给结论属 L3;必须执行写操作或有副作用才能完成工作属 L4。公开工具同样按这个边界区分。
来源:L1 第1步;L2 第七节;L3 第九、十二节;L4 第一节。
一条工作流,一道独立可读的例题
正文文件名按开头目录展示;第2步另写为 L1-你所在公司-你的姓名-001.md。两种写法在原文中并存,需确认,不自行统一。
- 提交编号中的公司是自己的公司,不是客户公司。文件夹名、正文条目编号、ZIP 主名三处一致。
- 来源企业、所属行业、岗位填全;客户代号在所有提交中保持一致。
- L1 文件不得夹带题目答案;这与 L2 起要求提交真人答案不同。
条目编号 → 来源企业 → 工作流概览 → 工作流分步 → 最难的一步 → 例题 → 文件世界 → 题型标注。
概览写清:这件事、触发、频率与批量、产出与去向、做错后果、整体耗时。
- 分步表除步号外,六列都填:做什么、用什么、产出、判断还是执行、Agent 能做吗、常见错误;至少 2 步是判断。
- 最难步骤必须同时回答凭什么难、老手凭什么知道;写真实错误及隐性经验。
- 只放一道例题;不看工作流也知道要产出什么,关键前提写进例题。
- 每个文件逐行登记文件名、这是什么、层级、解题角色;角色选必需证据/干扰项/无关背景,必需证据须确实有用。
- 封闭 / 开放必须勾选,用换种思路还能否答对来验证。点名文件进 visible,额外材料才进 searchable。
来源:L1 开头、第1—6步、各字段填法、「交付前自查」「红线」。
工作流之外,补齐判分证据
沿用 L1 的工作流写法;客户盖章授权放 authorization/,正文为工作流与任务.md。
每条评分点都有结论或理由、依据位置、判零条件、容差和权重;答案唯一用 closed,合理干法不止一种用 open。
真人实际做一遍,记录岗位经验、实际用时、自评、真实过程和最终答案。不是凭空编一份标准答案。
两份思路真正不同,不能只换同义词。两份答案开头各说明“这份跟另一份思路差在哪、为什么都对”。
写模型、运行时间、评分和错误分析;模型从头到尾的输出原样保留,一个字不改,不能用人的总结替代。
每个文件登记 path / layer / role / note,路径与实际文件一致;role 为 required_evidence / distractor / irrelevant。文件分 visible 和 searchable 两层,searchable 至少一个是解题真用得上的。
来源:L2 开头、第一—六节;价格来自 L1「这个场景还想多交几道题怎么办」。
不是交个答案,而是交可核验的依据
每条单独能判分;来源精确到文件的页、条款或表格位置;写明什么情况没分。数值容差:金额一般 ±0.01 元,比例一般 ±1%,不是所有任务一律套用。
批不批、过不过都要加理由评分点,理由的分值更高。不能只看碰巧选对结论;来源和判零条件仍需逐项写清。
只算动手干活时间,不计跑客户、写打分表、脱敏时间。记卡壳和转折。真人自评拿不到 80 分,回去检查任务或评分表。
手册正文列出 GPT-5.6 或 Claude Opus 4.8,是否允许其他模型见第4页待确认项。模型输出完整保留;跑 3 次至少错 2 次才值得交,3 次全对不交 L2。模型名仅按手册复述。
来源:L2 第二、三、五—八节。
冻结一块业务,不是只导出几张表
使用公开工具时另建 tools/public/,交付分类见第15页。开始前下载并跑通 sample-scenario-refund.zip 中的 verify.py。
tasks/task_001.md 列可用工具、背景、要做的事和答案交在哪;工具描述与 manifest 一致,as_of 必须与 SNAPSHOT.md 冻结日期一致。评分 source 也可定位到工具返回字段。
真人底稿逐步写工具名、参数、返回;失败样本保留模型原话,并记查错表、漏查、错参数、遇 OUT_OF_SNAPSHOT 放弃等情况。
① 真人正确路径留查询;② 模型跑三五遍,错误路径也留;③ 合并命中记录;④ 沿 ID 追关联,一般两三圈。指向的记录必须追;反向关联加业务限定,不能带走整库;追不到的注明位置及原因。
带上字典/枚举表和软删除记录;原来缺失的关联行不要补造;时间边界外记录也保留,查询靠 as_of 过滤。
SNAPSHOT.md 写冻结时点、表及条数、四步掏法、已知断链、脱敏说明、人造数据说明。
来源:L3 开头、第一—四节、第九、十二、十三节。
结构、逻辑、代码,用真实录制来验证
函数名与 adapters.py 完全一致;参数填名字、类型、必填、说明;返回填对象/列表、字段类型及含义、排序、条数限制;错误码及触发条件至少含 NOT_FOUND 和 OUT_OF_SNAPSHOT。
逐工具写数据来源、过滤条件、拼表方式与字段、排序和限制、业务口径。可向客户 IT 要 SQL、从配置反推或用边界查询验证;不能只写笼统的正常逻辑。
同输入同输出;不联网;不用全局变量或缓存记上次结果;时间只用 as_of,禁读系统当前时间;查询出错 raise ToolError。数据读本地 data.sqlite,不交 MCP server 封装。
正常 20、边界 7、异常 3;从线上真实录制,不许编。每条写 tool、input(含 as_of)、完整 expected_output、recorded_at、recorded_by、category。正常/边界/异常分布按原文要求。
报告开头必填采集时间、采集人、线上环境,缺一不通过。逐条比对真实录制与镜像;脱敏前后两份报告都保留,通过率必须完全相同。列工具统计、失败输入/预期/实际、差异原因、是否影响判分;已知可接受差异必须具体说明,不能只写排序略不同或微小偏差。
来源:L3 第五—八、十二节。原文要求差分测试通过,但未给出可据以新增统一 100% 门槛的规定;不擅加该门槛。
五步顺序不能反,映射表不带走
授权用途明确“用于模型训练”,原件拍照或扫描存 authorization/。笼统写数据合作不算。
在客户电脑上用真实录制跑差分,生成第一份 diff_report.md。原文:“人撤了就补不了。”
按下方四条硬规矩处理;真名假名映射表留在客户手里,不带出客户大门。
同一映射作用到样本,再生成第二份报告;通过率与第一次完全一致,检查关联是否被破坏。
数据、附带文件、任务、评分表、真人底稿和模型错题统一替换,不能分别改出不同代号。
① 关联 ID 必须对上,同人同公司跨表同假名;② ID 映射全局稳定;③ 所有日期向前或向后偏移同一天数;④ 枚举值和状态码不能动。具体偏移多少天,写入 SNAPSHOT.md。
检查目录/授权、文件登记/信息密度、五条代码规矩、评分来源/判零、差分通过率/三类覆盖、敏感信息和凭证。
同批查询连续两次逐字节一致;验收将系统时间往后拨一年重跑,结果必须完全不变。
来源:L3 第四、八、十—十二节。L4 第九、十节沿用授权脱敏及查询工具要求,写操作额外范围见第15页。
写得进去,也要按真实规则拒绝
任务、评分、底稿、文件、快照和查询工具沿用 L3;以下列写操作的新增与变化。
type 为 write;副作用具体到改哪张表哪个字段、触发什么动作;业务错误码各附提示;幂等键唯一标识请求,重复提交直接返回上次结果,不再改数据。
每个写工具都支持 dry_run。true 时走完包括拒绝规则在内的检查,跳过真实变更,返回 before / after / changes。成功 after 为完整改后状态;被拒 after 为 null,before 仍须返回。
写清允许执行的前提、执行后改哪些表的哪些字段。写函数也遵守 L3 的离线、时间等五条规矩;幂等和可回滚的写状态按 L4 写函数契约处理。
触发条件;返回错误码和提示语;为什么拒;对应工作流第几步。错误码/提示与 manifest.json、adapters.py 一致;规则文档与代码中的判断逻辑必须双向逐条对应。
来源:L4 第一—四节、第十节;查询工具五条规矩见 L3 第七节。
演练、回滚、回放,各有验收动作
正常查询之外还要录这三类写。拒绝样本每种错误码至少一条;同幂等键提交两次,第二次结果与第一次逐字节一致,不能再改数据。
线上和镜像用同批写请求,比 changes、after 和 error_code,不比真实数据变更;拒绝请求也列。报告含采集时间、采集人、线上环境。
执行一批写操作,确认改变;恢复操作前快照,确认回到初始;同批写操作再跑一次,结果与前一次逐字节一致。
纯函数型只交 declaration.md;有数据、能冻住型交 declaration.md、recordings.jsonl、diff_report.md,不另掏客户快照或写读逻辑。四步采集法同样适用,覆盖模型走错路的查询。
工具名/版本、提供方、获取方式/费率、工作流步号、副作用、训练用途条款、录制数量。附条款链接和查阅日期;明确禁止的别做,未说明则如实标注。未录查询返回 OUT_OF_SNAPSHOT,不能空返回或临时调真 API。
客户现场录真实请求和响应,包括被拒响应;不是反复真实发邮件、下单。manifest 标 type 为 write,拒绝规则写进清单。训练时只回放,不调用真实外发接口。
来源:L4 第一、五—十节;公开工具分类、声明、录制范围来自 L3 第九节。数据型公开工具抽验比结构及不随时间变化的字段。
敏感数据和生产权限,不进入交付包
真名与假名的映射表留在客户手里;交付包里的数据、文本、样本用同一映射,不能把映射表一起带出来。
真实公司名、人名、手机号、身份证、银行账号等须替换或涂掉。原始敏感材料不能混入 ZIP。
账号密码、token、能连接客户系统的地址、密钥、数据库连接串、回调地址禁止入包。L3/L4 代码不得硬编码真实地址/密钥,不连接远程服务;客户数据读本地快照。
L1 红线中的对照表指这道题的答案,禁止入包;L2 起则必须按对应手册交真人底稿及答案,不能把 L1 的禁令一概套到 L2–L4。
L1 / L2 / L3 / L4 各用本档前缀,接 -你所在公司-你的姓名-001;公司为提交者公司。文件夹名、正文编号、ZIP 主名一致;后续编号顺延。提交前逐项核对本档 checklist。
来源:L1 开头、第2、5、6步及「红线」;L2 开头、第八节末红线;L3 开头、第七、十、十二节;L4 开头、第九、十节。
先试一批,拿到反馈再决定投入
第3页明确数据边界与合作条件;第4页涉及时确认;第5页按需补问。保存答复,不把可选项当成开工门槛。
L3 手册附 sample-scenario-refund.zip,解压后运行 python3 verify.py;团队对照真实文件理解交付结构。
内部试点可选 1 条 L1、1 道 L2;先确认接收安排,再用实际反馈判断任务和评分材料是否合格。
记录访谈、整理、模型调用、脱敏和返工用时;按已确认价格、验收反馈和实际成本决定是否批量做。
确认客户授权和现场安排,评估切片、录制、开发、复测及回滚成本;收益尚不清楚时,不预设高档更赚钱。
先验证交付和合作条件,再安排批量投入。
手册依据:样例及运行命令见 L3 第一、十一、十三节。试点规模、团队分工和投入节奏为内部建议。
三件事,把不确定性逐项确认
按第3页先明确数据边界、价格、结算、返修、验收与提交入口;第4页按实际情形确认,第5页可选。已知手册要求直接执行。
对照四册和 sample-scenario-refund.zip,运行 verify.py;确认团队能解释材料、测试和授权各在解决什么问题。
L1 看工作流、判断点和后果;准备 L2 再核验模型失败与真人评分。先获得真实反馈,再评估 L3/L4。
先确认合作条件,再按真实业务准备材料。
四册没有给出档位越深、单价越高的价格关系。
手册依据:L1 第1步及 L2 介绍节;L2 第七节;L3 第一、十一、十三节。行动安排为内部建议。