导览 · 这份演示讲什么

一页看懂:标题大纲手册原文入口

先明白字节为什么收材料,再按优先级明确合作条件,然后看各档材料要求;最后附上内部执行安排。必须确认、涉及时确认、可选确认分开展示。

模块一 · 四份官方手册(点击卡片直达原文 ↗)
L4 · 再练实际操作可写的模拟器

wiki/Iq8pwJ…aonrp ↗

模块二 · 确认清单(P3–5)先分清:必须确认还是可选

第3页:必须确认 · 第4页:涉及时必须确认 · 第5页:可选确认。优先级为内部安排,非字节新增要求。

模块三 · 执行要点(P6–16)四册手册要求了什么

总览与挑活 · L1 交什么 · L2 出卷与硬规矩 · L3 查询环境与脱敏 · L4 写工具 · 共同红线(第16页)

怎么看这份稿:导览(本页)→ 目的(第2页)→ 确认清单(第3–5页)→ 材料要求(第6–16页)→ 内部安排(第17–18页)。

本页性质:四个链接指向官方手册原文;模块说明是对本稿结构的概括,非手册内容。

01 / 18
L1–L4 · 字节为什么要收这些材料

把企业里的真实工作,
变成智能体能反复练习的题目和环境

通俗地说:收集企业真实、复杂、模型还容易做错的活,
让智能体学会按业务规则把活做对,并能检验它到底做得怎么样。

L1 · 先弄清工作收集真实场景

这件活平时怎么干?
哪些地方要拿主意?
做错会有什么后果?

L2 · 再做成题目知道怎样算做对

真人怎么做、模型错在哪,
都留下来;配上评分标准,
才知道智能体有没有进步。

L3 · 搭查询环境能反复查、反复练

把相关数据和查询工具
做成固定的练习环境,
每次都能复现同样的结果。

L4 · 再练实际操作学会执行,也学会拒绝

在能还原的环境里练写操作;
该执行时执行,该拒绝时拒绝,
训练时不真的向外部发起操作。

交付重点:不只是描述一个需求,而是准备好业务流程、评分依据、真实错题和可复现的练习环境

按优先级推进:第 3 页必须确认 → 第 4 页涉及时确认 → 第 5 页可选确认;材料要求见第 6–16 页,内部安排见第 17–18 页。

目的概括,非逐字引述:L1 开头;L2 第三、五节;L3 开头;L4 第一、四、七、八节。
本稿引号内为原文;其余为摘要。确认清单和行动安排单独标注,不能当作手册新增要求。

02 / 18
高优先级 · 必须确认
第3页 · 内部确认清单 · 非文档新增要求

必须先确认:数据边界与合作条件

以下优先级是我们的内部安排。按各项时点确认后再进行对应操作;不影响先读手册、跑样例,不要求等第 5 页的可选项全部答完。

采集 / 试跑前客户数据能怎么用、能发给谁?与字节及客户确认有无指定授权模板、有效期及接收方、留存、再流转边界;尤其是第三方模型试跑允许哪些数据、是否先脱敏、用哪个获准环境。不能仅凭训练用途推定这些安排已获同意。
正式投入前本次是否接收,交到哪里、何时截止?向字节确认档位、客户行业 / 规模是否另有门槛、批次配额、截止时间和真实提交入口。L1 第6步仍写“多维表格地址待补充”;不能先批量做完再问收不收。
正式投入前本次单价、计价单位和价格有效期是什么?L1 介绍 L2 写“一道 2000 元”;L1、L3、L4 单价未列。向字节确认本次报价及计价单位,不能把文档价格当成已经谈妥的合作报价。
正式投入前和谁签约,满足什么条件、多久能结算?向字节对接方明确合同及付款主体、发票要求、支付条件、结算周期。手册没有完整写明这些合作安排。
正式投入前谁负责验收,多久给结果,失败怎样反馈?确认验收对接人、周期、逐项失败反馈及复验流程。手册已有技术要求;这里确认协作安排,不是重新协商是否执行硬性要求。
正式投入前返修怎样处理,安全责任与返工成本如何分担?明确返修次数、期限、报酬变化,以及现场复测、重复脱敏、授权续期的责任和成本。与合作各方落实分工;不能用责任未谈妥代替执行脱敏红线。

已知依据:L1 第6步及 L2 介绍节;L2 第五节;L3 第十节;L4 第九节。
边界:具体商务及数据流转安排在四册正文中未完整写明;先查已有协议与样例材料,再补问缺项。必须确认的分级属于内部判断。

03 / 18
中优先级 · 涉及时必须确认
第4页 · 内部确认清单 · 非文档新增要求

涉及时必须确认:模型、验收与交付口径

按你实际做的档位和情形选项;触发了就先确认,再做该项。未涉及的项目不阻断当前档位;手册已明确的规则继续执行。

L2–L4 试跑前可选模型有哪些,是否限定型号或版本?L2 正文列 GPT-5.6 或 Claude Opus 4.8,并未明确说仅举例。向字节确认替代模型范围及版本填写精度;模板已有“用的什么模型”,记录模型不是可选项。
L3/L4 存在差异时哪些差异可接受,由谁最终判定?先查样例脚本和既有验收说明,再问未明确的阈值与认定流程。已知须写清差异及对判分的影响,脱敏前后通过率完全相同;相同不等于自动合格。
扩样 / 使用公开工具前样本数量和分类怎样分别计算?L3 自建工具自查:每工具至少 30 条,正常20 / 边界7 / 异常3;公开工具示例:50条,正常30 / 边界15 / 异常5。超量分配及两类适用口径分别确认,不擅自互套。
L4 现场录制前客户系统能否按要求演练写操作?与字节及客户 IT 确认 dry_run 能力、现场操作范围和录制安排。手册要求线上与镜像均以 dry_run 做写差分,授权须额外覆盖此录制;不支持时暂停该项,不改成真实写入。
L1 首次打包前正文文件名究竟采用哪一种?L1 开头写工作流与任务.md,第2步写 L1-你所在公司-你的姓名-001.md。两处确有差异,向字节确认当前接收口径;不妨碍先整理正文内容。
多人 / 同场景协作前如何登记、去重及确定提交归属?报备和多人协作机制未写明,触发时向字节确认。已知同一客户场景只交一条 L1,多举例子不加钱;其他题按 L2 准备,不能重新问成 L1 能否重复计费。

已知依据:L1 开头、第2步及 L2 介绍节;L2 第一、五节;L3 第八、九、十二节;L4 第六、九节。
内部判断:仅暂停触发项对应的操作。L2 材料清单已有答案,不再把三样 / 四样的概括差异作为等待开工的理由。

04 / 18
低优先级 · 可选确认
第5页 · 内部确认清单 · 非文档新增要求

可选确认:有需要再问,不额外卡开工

以下是实施支持与额外合作诉求,不是每个项目都要先得到答复。可选的是补问,不是手册要求;已发现不合规或执行不通时,必须先解决对应问题。

可选 · 方案拿不准时是否有指定脱敏方案或日期偏移标准?先查现有约定;正文未指定统一偏移天数。没有指定标准时,按客户侧方案满足手册规则并记录偏移天数;拿不准就问,不把等待字节指定某个天数当成通用前置条件。
可选 · 需要支持时是否提供技术答疑渠道和响应安排?可向字节索取 L3/L4 技术联系人及支持方式。先下载样例、运行 verify.py;若差分或自检失败,必须解决后再交,但不必先拿到响应时限才能练习。
可选 · 有额外诉求时是否另谈署名或追加收益?手册没有承诺这些权益,没有此诉求就不增加谈判项;若要把它作为参与条件,则提前谈妥。数据使用和再流转边界不在可选范围,按第 3 页先明确。
已经写明:直接执行,不列为可选

L2 交付:评分表、真人底稿、模型错题、文件清单;开放任务再交第二份思路不同的真人答案。模型信息按模板记录。

授权与脱敏:授权用途写“用于模型训练”;L2–L4 要求客户盖章,L4 额外覆盖 dry_run 写操作录制。L3/L4 在客户侧脱敏,对照表留给客户;关联一致、映射稳定、日期统一偏移、枚举和状态码不变,前后差分通过率相同。

已知依据:L1 开头及红线后提示;L2 开头、第一、四、五节;L3 第四、十、十一节;L4 第九节。
内部安排:可选确认的分级不改变任何验收要求;无指定方案不等于已通过验收。

05 / 18
第6页 · 四册总览

四档的区别,是交付内容

内容逐档递进;目录按对应手册重组,不能直接把低档目录原样叠加。

L1 · 工作流记清一件真实的活

去客户现场问清工作流、判断点和做错的后果;一个客户场景只交一条 L1、一道例题。不要求评分标准,也不要求搭系统。

L2 · 评分材料能判分,有真人和错题

补评分表、真人底稿、模型失败原话、文件清单。真人底稿证明“这件活真人是能干对的”;失败样本证明“这件活模型现在还干不好”。

L3 · 查询环境冻结数据,复现查询

数据快照、工具说明与代码、真实查询录制和差分测试,支持“让我们不在你身边的时候也能查到同样的数据、跑出同样的结果”。

L4 · 写操作能改状态,也知道何时拒绝

在 L3 基础上增加能写的工具和写操作拒绝规则清单;补写操作样本、演练、回滚与授权范围。

原文:“L2 在 L1 的基础上多交四样东西。”
执行按 L2 自册的具体文件清单;L1 介绍的三样未列文件清单,不再把概括数量差异当作开工阻断项。

来源:L1「你要交的是什么」「这个场景还想多交几道题怎么办」;L2 开头、第一、三、五节;L3 开头、第一节;L4 第一节。

06 / 18
第7页 · 先按档位筛选

L1 的条件,不能混成 L2 的门槛

L1 · 三条场景要求步骤、判断、后果

原文:“真实的复杂工作一般 6~15 步。只有两三步的,交上来大概率算低价值场景。”
至少 2 步需要判断;做错有后果。模型失败率和真人评分不是 L1 的要求。

L2 · 三条筛选标准多处查证、模型会错、真人能做对

老师傅要翻好几个地方才能下结论;模型跑 3 次,至少 2 次答错;真人按评分表能拿到 80 分以上。真人拿不到 80 分,先检查任务是否说清、评分是否过严。

L3 · 客户系统场景工具和系统确实不可替代

跨系统查证,有版本冲突或干扰信息。原文:“至少调了三个以上的工具函数、跨了两张以上的表”。仅靠文件就能完成的是 L2。公开查询服务也可属 L3,按第九节处理。

L2 常见合格场景多来源 · 多版本 · 易误用的信息

单看一份材料会错;需判断哪版规则有效;存在确实见过模型或新人踩中的误导信息。

L3 / L4 分界是否必须改变系统状态

只查询、判断、给结论属 L3;必须执行写操作或有副作用才能完成工作属 L4。公开工具同样按这个边界区分。

来源:L1 第1步;L2 第七节;L3 第九、十二节;L4 第一节。

07 / 18
第8页 · L1 手册

一条工作流,一道独立可读的例题

L1-你所在公司-你的姓名-001.zip └── L1-你所在公司-你的姓名-001/ ├── 工作流与任务.md ├── authorization/ └── files/ ├── visible/ └── searchable/ (L1 可选)

正文文件名按开头目录展示;第2步另写为 L1-你所在公司-你的姓名-001.md。两种写法在原文中并存,需确认,不自行统一。

  • 提交编号中的公司是自己的公司,不是客户公司。文件夹名、正文条目编号、ZIP 主名三处一致。
  • 来源企业、所属行业、岗位填全;客户代号在所有提交中保持一致
  • L1 文件不得夹带题目答案;这与 L2 起要求提交真人答案不同。
正文模板 · 不改字段

条目编号 → 来源企业 → 工作流概览 → 工作流分步 → 最难的一步 → 例题 → 文件世界 → 题型标注。
概览写清:这件事、触发、频率与批量、产出与去向、做错后果、整体耗时。

  • 分步表除步号外,六列都填:做什么、用什么、产出、判断还是执行、Agent 能做吗、常见错误;至少 2 步是判断。
  • 最难步骤必须同时回答凭什么难、老手凭什么知道;写真实错误及隐性经验。
  • 只放一道例题;不看工作流也知道要产出什么,关键前提写进例题。
  • 每个文件逐行登记文件名、这是什么、层级、解题角色;角色选必需证据/干扰项/无关背景,必需证据须确实有用。
  • 封闭 / 开放必须勾选,用换种思路还能否答对来验证。点名文件进 visible,额外材料才进 searchable。

来源:L1 开头、第1—6步、各字段填法、「交付前自查」「红线」。

08 / 18
第9页 · L2 手册 · 材料清单

工作流之外,补齐判分证据

沿用 L1 的工作流写法;客户盖章授权放 authorization/,正文为工作流与任务.md。

rubrics/task_001.json打分表

每条评分点都有结论或理由、依据位置、判零条件、容差和权重;答案唯一用 closed,合理干法不止一种用 open。

baselines/human_baseline.md真人底稿

真人实际做一遍,记录岗位经验、实际用时、自评、真实过程和最终答案。不是凭空编一份标准答案。

baselines/human_baseline_2.md开放任务才交第二份

两份思路真正不同,不能只换同义词。两份答案开头各说明“这份跟另一份思路差在哪、为什么都对”。

baselines/failure_sample.md模型失败原话

写模型、运行时间、评分和错误分析;模型从头到尾的输出原样保留,一个字不改,不能用人的总结替代。

workspace/files_manifest.json + workspace/files/

每个文件登记 path / layer / role / note,路径与实际文件一致;role 为 required_evidence / distractor / irrelevant。文件分 visible 和 searchable 两层,searchable 至少一个是解题真用得上的。

L1 对 L2 的价格原句节选:“酬劳按道算,一道 2000 元。”此处仅复述手册价格,不代表已确认结算周期、返修政策或 L1/L3/L4 价格。

来源:L2 开头、第一—六节;价格来自 L1「这个场景还想多交几道题怎么办」。

09 / 18
第10页 · L2 手册 · 判分与底稿

不是交个答案,而是交可核验的依据

评分三条规矩独立判分 · 具体位置 · 判零条件

每条单独能判分;来源精确到文件的页、条款或表格位置;写明什么情况没分。数值容差:金额一般 ±0.01 元,比例一般 ±1%,不是所有任务一律套用。

二选一不能只看结论理由也单独判,且分值更高

批不批、过不过都要加理由评分点,理由的分值更高。不能只看碰巧选对结论;来源和判零条件仍需逐项写清。

真人底稿真实用时 · 真实卡点 · 按表自评

只算动手干活时间,不计跑客户、写打分表、脱敏时间。记卡壳和转折。真人自评拿不到 80 分,回去检查任务或评分表。

模型错题跑 3 遍,留代表性的失败

手册正文列出 GPT-5.6 或 Claude Opus 4.8,是否允许其他模型见第4页待确认项。模型输出完整保留;跑 3 次至少错 2 次才值得交,3 次全对不交 L2。模型名仅按手册复述。

原文:“硬规矩:searchable 里至少要有一个文件是干活真用得上的。”任务直接点名的进 visible;未点名但需要自行查找的进 searchable。

来源:L2 第二、三、五—八节。

10 / 18
第11页 · L3 手册 · 任务、轨迹与快照

冻结一块业务,不是只导出几张表

L3-你所在公司-你的姓名-001/ ├── authorization/ ├── tasks/task_001.md ├── rubrics/ + baselines/ (两个同级目录) ├── workspace/ │ ├── files/ (visible/ + searchable/) │ ├── files_manifest.json │ ├── snapshot/ │ │ ├── data.sqlite │ │ └── SNAPSHOT.md │ └── tools/ │ ├── manifest.json │ ├── read_logic.md │ ├── adapters.py │ └── fixtures/ │ ├── fixtures.jsonl │ └── diff_report.md └── verify.py

使用公开工具时另建 tools/public/,交付分类见第15页。开始前下载并跑通 sample-scenario-refund.zip 中的 verify.py。

任务与底稿

tasks/task_001.md 列可用工具、背景、要做的事和答案交在哪;工具描述与 manifest 一致,as_of 必须与 SNAPSHOT.md 冻结日期一致。评分 source 也可定位到工具返回字段。

真人底稿逐步写工具名、参数、返回;失败样本保留模型原话,并记查错表、漏查、错参数、遇 OUT_OF_SNAPSHOT 放弃等情况。

四步掏法

① 真人正确路径留查询;② 模型跑三五遍,错误路径也留;③ 合并命中记录;④ 沿 ID 追关联,一般两三圈。指向的记录必须追;反向关联加业务限定,不能带走整库;追不到的注明位置及原因。

四类漏项 + 快照说明

带上字典/枚举表和软删除记录;原来缺失的关联行不要补造;时间边界外记录也保留,查询靠 as_of 过滤。
SNAPSHOT.md 写冻结时点、表及条数、四步掏法、已知断链、脱敏说明、人造数据说明。

来源:L3 开头、第一—四节、第九、十二、十三节。

11 / 18
第12页 · L3 手册 · 工具五件套

结构、逻辑、代码,用真实录制来验证

manifest.json说明每个工具的调用契约

函数名与 adapters.py 完全一致;参数填名字、类型、必填、说明;返回填对象/列表、字段类型及含义、排序、条数限制;错误码及触发条件至少含 NOT_FOUND 和 OUT_OF_SNAPSHOT。

read_logic.md写出数据怎么算出来

逐工具写数据来源、过滤条件、拼表方式与字段、排序和限制、业务口径。可向客户 IT 要 SQL、从配置反推或用边界查询验证;不能只写笼统的正常逻辑。

adapters.py · 五条硬规矩确定、离线、无跨调用缓存、时间冻结、统一错误

同输入同输出;不联网;不用全局变量或缓存记上次结果;时间只用 as_of,禁读系统当前时间;查询出错 raise ToolError。数据读本地 data.sqlite,不交 MCP server 封装。

fixtures/fixtures.jsonl每个工具至少 30 条:20 / 7 / 3

正常 20、边界 7、异常 3;从线上真实录制,不许编。每条写 tool、input(含 as_of)、完整 expected_output、recorded_at、recorded_by、category。正常/边界/异常分布按原文要求。

fixtures/diff_report.md · 两次测试、两份报告

报告开头必填采集时间、采集人、线上环境,缺一不通过。逐条比对真实录制与镜像;脱敏前后两份报告都保留,通过率必须完全相同。列工具统计、失败输入/预期/实际、差异原因、是否影响判分;已知可接受差异必须具体说明,不能只写排序略不同或微小偏差。

来源:L3 第五—八、十二节。原文要求差分测试通过,但未给出可据以新增统一 100% 门槛的规定;不擅加该门槛。

12 / 18
第13页 · L3 手册 · 授权脱敏与自检

五步顺序不能反,映射表不带走

STEP 1
客户先盖章

授权用途明确“用于模型训练”,原件拍照或扫描存 authorization/。笼统写数据合作不算。

STEP 2
脱敏前先测

在客户电脑上用真实录制跑差分,生成第一份 diff_report.md。原文:“人撤了就补不了。”

STEP 3
客户电脑上脱敏

按下方四条硬规矩处理;真名假名映射表留在客户手里,不带出客户大门。

STEP 4
脱敏后再测

同一映射作用到样本,再生成第二份报告;通过率与第一次完全一致,检查关联是否被破坏。

STEP 5
同一映射覆盖全包

数据、附带文件、任务、评分表、真人底稿和模型错题统一替换,不能分别改出不同代号。

脱敏四条硬规矩关联不散、映射不漂、日期同移、枚举不变

① 关联 ID 必须对上,同人同公司跨表同假名;② ID 映射全局稳定;③ 所有日期向前或向后偏移同一天数;④ 枚举值和状态码不能动。具体偏移多少天,写入 SNAPSHOT.md。

python3 verify.py · 全绿才能交自检不仅看目录

检查目录/授权、文件登记/信息密度、五条代码规矩、评分来源/判零、差分通过率/三类覆盖、敏感信息和凭证。
同批查询连续两次逐字节一致;验收将系统时间往后拨一年重跑,结果必须完全不变。

来源:L3 第四、八、十—十二节。L4 第九、十节沿用授权脱敏及查询工具要求,写操作额外范围见第15页。

13 / 18
第14页 · L4 手册 · 写工具契约

写得进去,也要按真实规则拒绝

任务、评分、底稿、文件、快照和查询工具沿用 L3;以下列写操作的新增与变化。

manifest.json · 四项新增type / side_effects / business_errors / idempotency_key

type 为 write;副作用具体到改哪张表哪个字段、触发什么动作;业务错误码各附提示;幂等键唯一标识请求,重复提交直接返回上次结果,不再改数据。

adapters.py · dry_run 与返回状态默认 false;true 时演练但不真改

每个写工具都支持 dry_run。true 时走完包括拒绝规则在内的检查,跳过真实变更,返回 before / after / changes。成功 after 为完整改后状态;被拒 after 为 null,before 仍须返回。

read_logic.md · 补写执行条件什么前提允许,执行改哪里

写清允许执行的前提、执行后改哪些表的哪些字段。写函数也遵守 L3 的离线、时间等五条规矩;幂等和可回滚的写状态按 L4 写函数契约处理。

write_rejection_rules.md · 缺少则整包退回四件事,每条写齐

触发条件;返回错误码和提示语;为什么拒;对应工作流第几步。错误码/提示与 manifest.json、adapters.py 一致;规则文档与代码中的判断逻辑必须双向逐条对应

原文:“拒绝规矩不是越多越好。”每条拒绝都要在真实工作流判断或明确制度中找到出处;客户真实系统允许的操作,不能凭空多拦一道。

来源:L4 第一—四节、第十节;查询工具五条规矩见 L3 第七节。

14 / 18
第15页 · L4 验证 / L3–L4 公开工具

演练、回滚、回放,各有验收动作

fixtures.jsonl · 三种写样本允许 / 拒绝 / 重复

正常查询之外还要录这三类写。拒绝样本每种错误码至少一条;同幂等键提交两次,第二次结果与第一次逐字节一致,不能再改数据。

diff_report.md · 写工具差分两边都 dry_run=true

线上和镜像用同批写请求,比 changes、after 和 error_code,不比真实数据变更;拒绝请求也列。报告含采集时间、采集人、线上环境。

回滚 · 非 dry_run执行 → 查变更 → 回滚 → 查还原 → 重跑

执行一批写操作,确认改变;恢复操作前快照,确认回到初始;同批写操作再跑一次,结果与前一次逐字节一致。

公开工具 · L3 两类交付纯函数仅声明;数据型要录制

纯函数型只交 declaration.md;有数据、能冻住型交 declaration.md、recordings.jsonl、diff_report.md,不另掏客户快照或写读逻辑。四步采集法同样适用,覆盖模型走错路的查询。

declaration.md · 每工具一行声明完整,未录查询明确超范围

工具名/版本、提供方、获取方式/费率、工作流步号、副作用、训练用途条款、录制数量。附条款链接和查阅日期;明确禁止的别做,未说明则如实标注。未录查询返回 OUT_OF_SNAPSHOT,不能空返回或临时调真 API。

公开工具 · 有副作用属 L4public/ 下录制回放,训练不外发

客户现场录真实请求和响应,包括被拒响应;不是反复真实发邮件、下单。manifest 标 type 为 write,拒绝规则写进清单。训练时只回放,不调用真实外发接口。

L4 授权书的范围额外覆盖:“在客户系统上以 dry_run 方式执行写操作并录制”。

来源:L4 第一、五—十节;公开工具分类、声明、录制范围来自 L3 第九节。数据型公开工具抽验比结构及不随时间变化的字段。

15 / 18
第16页 · 共同红线 + 分档红线

敏感数据和生产权限,不进入交付包

脱敏对照表客户留存,不带走不提交

真名与假名的映射表留在客户手里;交付包里的数据、文本、样本用同一映射,不能把映射表一起带出来。

未处理原始文件先在客户处脱敏

真实公司名、人名、手机号、身份证、银行账号等须替换或涂掉。原始敏感材料不能混入 ZIP。

凭证和系统连接方式不交生产访问权限

账号密码、token、能连接客户系统的地址、密钥、数据库连接串、回调地址禁止入包。L3/L4 代码不得硬编码真实地址/密钥,不连接远程服务;客户数据读本地快照。

L1 特有 · 不等于脱敏映射表题目答案不能夹带

L1 红线中的对照表指这道题的答案,禁止入包;L2 起则必须按对应手册交真人底稿及答案,不能把 L1 的禁令一概套到 L2–L4。

ZIP + 多维表格编号用本档前缀,名称一致

L1 / L2 / L3 / L4 各用本档前缀,接 -你所在公司-你的姓名-001;公司为提交者公司。文件夹名、正文编号、ZIP 主名一致;后续编号顺延。提交前逐项核对本档 checklist。

L2 原文:“模板里的字段名和文件名一个字都别改——我们有脚本按字段名读取,改了就读不到。”

来源:L1 开头、第2、5、6步及「红线」;L2 开头、第八节末红线;L3 开头、第七、十、十二节;L4 开头、第九、十节。

16 / 18
内部建议 · 非文档要求
第17页 · 团队内部执行节奏

先试一批,拿到反馈再决定投入

STEP 1
按优先级确认

第3页明确数据边界与合作条件;第4页涉及时确认;第5页按需补问。保存答复,不把可选项当成开工门槛。

STEP 2
对照样例校准

L3 手册附 sample-scenario-refund.zip,解压后运行 python3 verify.py;团队对照真实文件理解交付结构。

STEP 3
小批试交

内部试点可选 1 条 L1、1 道 L2;先确认接收安排,再用实际反馈判断任务和评分材料是否合格。

STEP 4
算清单位成本

记录访谈、整理、模型调用、脱敏和返工用时;按已确认价格、验收反馈和实际成本决定是否批量做。

STEP 5
评估 L3/L4 投入

确认客户授权和现场安排,评估切片、录制、开发、复测及回滚成本;收益尚不清楚时,不预设高档更赚钱。

先验证交付和合作条件,再安排批量投入。

手册依据:样例及运行命令见 L3 第一、十一、十三节。试点规模、团队分工和投入节奏为内部建议。

17 / 18
内部建议 · 非文档要求
第18页 · 下一步行动

三件事,把不确定性逐项确认

一 · 对外确认先问必须项,再问触发项

按第3页先明确数据边界、价格、结算、返修、验收与提交入口;第4页按实际情形确认,第5页可选。已知手册要求直接执行。

二 · 对内校准读原文,跑样例

对照四册和 sample-scenario-refund.zip,运行 verify.py;确认团队能解释材料、测试和授权各在解决什么问题。

三 · 选试点按目标档位筛第一个场景

L1 看工作流、判断点和后果;准备 L2 再核验模型失败与真人评分。先获得真实反馈,再评估 L3/L4。

先确认合作条件,再按真实业务准备材料。
四册没有给出档位越深、单价越高的价格关系。

手册依据:L1 第1步及 L2 介绍节;L2 第七节;L3 第一、十一、十三节。行动安排为内部建议。

18 / 18
01 / 18
← → 翻页 · Home/End 首末 · P 打印版