数据科学项目手册
1. 业务驱动与目标
数据科学通过统计、机器学习和多样来源发现关系、解释现象或预测结果,并让业务能据此行动。目标写成可检验的业务问题:谁在何时根据结果做什么决定;相对于什么基线;收益、成本和可能损害怎样衡量;哪些结果不能自动决定。
假设卡至少写:目标人群/流程、问题、备择与零假设、预期机制、可用数据、关键混杂/偏差、主要/护栏指标、对照方案、统计或运营成功条件、失败/停止条件、owner。探索阶段可以迭代,但部署前需冻结最终评估协议,避免在同一测试集上反复调参并把偶然结果当验证。
小样本描述性分析、统计解释、预测、推荐和自动化决策有不同证据与风险门。对客户产生重大影响的用途必须先获授权;“辅助决策”也要评估人为过度依赖和申诉/纠错路径。
2. 原则与关键概念
- 科学方法: 观察、提出假设、设比较、实验/建模、独立评估、解释与修订;记录失败假设和选择过程。
- 来源服务于问题: 数据类型、量、速度不能单独证明价值。选源需核查来源、含义、代表性、更新、许可、用途、质量、连接与长期可得性。
- 最小必要数据: 不因湖能存而全量收集;敏感数据的重组和小群体输出也可能识别个人。
- 时间与标签正确: 训练样本只能包含预测时点实际可得信息;标签定义、成熟/延迟、删失和人工反馈要可审计。
- 评估独立: 分离训练、验证和独立测试;按时间/主体/场景防泄漏,并与简单规则或现有流程比较。
- 双重质量: 输入数据质量和模型方法都影响结果;总体指标需结合分群、误差成本、校准、漂移与业务护栏。
- 可复现: 保存数据快照/水位、代码、依赖/环境、特征定义、标签、种子、参数、模型、阈值和运行记录。
- 持续风险管理: 来源、用途、模型、阈值或人群变化须再评估;上线后保留降级、回滚和退役通道。
可视化服务于受众和问题:明确尺度、基数、时间、分群、置信或不确定性,不用截断坐标、过小群体或选择性筛选误导决策。探索图和对外/运营图有不同发布门。
3. Plan / Control / Develop / Operate
Plan
- 定义业务目标、假设、决策动作、现有基线、收益与伤害、授权边界和阶段门。
- 评估已有数据缺口,逐源选择或拒绝:来源、格式、粒度、时间、代表性、质量、许可/用途、访问、保留和再识别。
- 设计实验/评估:目标、标签、预测时点、抽样、切分、对照、指标、分群、统计功效/不确定性与停机规则。
- 评估平台、成本、延迟、人工容量和部署形式;选择最小可行来源与模型。
Control
- 对用途、敏感特征、数据共享、受保护群体、解释、客户影响和结果发布设审批与独立挑战。
- 冻结训练/测试和评估协议,管理数据/特征/模型/阈值版本、试验记录与候选淘汰理由。
- 在发布门核验业务价值、模型风险、质量、偏差、安全隐私、运行、人工作业和回滚。
- 将新来源、新特征、重新训练、阈值/用途/人群扩大纳入影响分析和再验证。
Develop
- 在受控环境接入、画像、去重/连接、时间对齐和质量检查;保留原始来源与数据血缘。
- 通过探索检验假设,设计特征/标签;检查泄漏、代理变量、缺失、异常、抽样偏差和样本代表性。
- 建简单基线,训练/调参多种可解释的候选;固定验证与独立测试,记录失败、成本和资源。
- 评估总体与分群的辨别、校准、误报/漏报、覆盖、置信区间、时间稳定、漂移敏感性和业务效用。
- 为决策者制作准确、可理解、带限制的图表/说明;验证受众能正确行动而非只会复述分数。
Operate
- 影子运行/灰度,比较离线与生产特征、输入质量、延迟、结果分布和人工决定。
- 监控服务、特征/来源版本、漂移、校准、真实结果/延迟标签、分群误差、客户反馈和人工队列。
- 越界时暂停或降级到已批准规则/人工流程;记录影响、保全证据、回滚和沟通。
- 按周期或触发事件再验证、重训/再批准、更新文档;收益不足或风险不可控时退役。
4. 上下文与角色
| 角色 | 责任与决策权 |
|---|---|
| 业务 sponsor/决策 owner | 批准用途、动作边界、收益/损害权重、人工流程与上线业务验收 |
| 数据 owner/管家 | 批准来源用途、定义/质量、保留、变更和源缺陷处理 |
| 数据科学负责人 | 设计假设、样本、特征、模型、评估与可复现实验 |
| 独立模型验证/风险 | 挑战泄漏、方法、偏差、解释、阈值、局限和再验证条件 |
| 数据工程/集成 | 提供来源契约、接入、对齐、特征血缘、质量和重放 |
| 平台/MLOps/运行 | 实现版本、部署、监控、告警、灰度、回滚、保留和支持 |
| 业务复核运营 | 负责人工决策、队列容量、培训、推翻理由、申诉和反馈质量 |
| 隐私/安全/合规/伦理 | 按各自权限审查允许用途、敏感数据、公平影响、访问、输出与风险 |
| 受影响者/用户代表 | 检验结果解释、纠错、申诉和实际损害,反馈不可见群体问题 |
模型开发者不得独自批准自身模型的独立验证或客户重大影响的自动化扩展。业务与控制职能的否决权、审批版本和例外到期应在项目开始确定。
5. 交付物与验收证据
业务假设与实验协议
- 业务问题、决策时点、动作和禁止自动动作:
- 目标人群/单位、现有规则/人工基线与对照组:
- 假设、可证伪观察、主要效益与伤害护栏:
- 标签定义/成熟期、预测时点和可得特征:
- 样本/排除/分层、训练/验证/独立测试或随机实验:
- 时间/主体泄漏防护、统计功效/置信和多次试验处理:
- 误报/漏报成本、阈值选择、人工容量:
- 成功/停止条件、批准人、协议冻结版本:对风险模型:离线准确率必须与现有规则和人工流程比较;使用时间外测试并检查同客户/设备跨切分泄漏。对缺少及时真实标签的场景,先定义延迟标签和代理指标的局限,不能把影子期代理指标等同最终业务效果。
来源与数据/特征/标签卡
| 来源/字段/特征 | 业务必要性/增量价值 | 来源/许可/用途 | 粒度/时间/更新 | 代表性/缺失/偏差 | 敏感/代理/重识别 | 连接/血缘 | Owner/批准 |
|---|
数据卡记录采集过程、对象/排除、时间跨度、质量/缺失、已知偏差、允许用途、保留、访问和版本。特征卡记录每个预测时点的可得性、源字段、变换、窗口、默认/缺失、敏感代理测试、训练/生产实现一致性。标签卡记录事实定义、产生者、成熟延迟、误标/反馈偏差、删失和争议处理。新增来源先做合法性、质量、代表性、增量效果与小群体风险评估,再决定接入。
实验复现与模型卡
复现清单:数据快照/水位/哈希,样本抽取和切分 ID,特征/标签代码版本,依赖/环境与硬件,随机种子,参数/阈值,训练日志,模型工件/签名,评估脚本与结果,审批和限制。独立验证者在受控环境用同一输入复现关键结果;非确定性差异定义容差与解释。
| 评价 | 最小证据 | 阻断/例外 |
|---|---|---|
| 业务效用 | 相对现有基线的收益、错误成本、人工量、置信区间 | 无净收益或伤害越限 |
| 统计表现 | 独立集辨别、校准、误报/漏报、覆盖、稳定性 | 测试泄漏、过拟合、标签不可靠 |
| 分群与公平 | 获批分群样本量、误差、覆盖、校准/推翻、差异及不确定性 | 高损害差异未解释/未缓解 |
| 解释与使用 | 理由代码与实际特征一致、用户理解、可申诉 | 人工过度依赖或虚假解释 |
| 运行可行 | 生产输入可得、延迟、成本、容量、恢复与监控 | 生产不可重现或无法安全降级 |
模型卡写明目的、训练/评估群体、来源、版本、方法、结果、适用/不适用场景、伦理/隐私风险、分群限制、阈值、人工边界、监控、批准和下次复审。不得因为总体准确率达标而隐藏小样本、不确定性或群体差异。
沟通与可视化
针对业务、审查、运行、受影响客户等受众分别说明:问题、证据、替代方案、预期行动、限制、样本/分母、置信度和谁能纠错。图表检查轴、基线、时间窗、分群大小、置信区间、颜色、筛选和可访问性;敏感小群体视图/导出需审查再识别风险。保留图表查询、数据/模型版本及批准记录。
上线、监控、回滚和退役
| 阶段门 | 所需证据 | 决定者/失败动作 |
|---|---|---|
| 设计准入 | 业务假设、用途/来源批准、数据分类、人工边界 | 业务/数据/隐私;未批源不进入实验 |
| 模型准入 | 协议、独立测试、复现、分群/代理、解释和限制 | 独立模型风险;失败回到探索 |
| 技术准入 | 版本/血缘、访问、服务/批次、质量、审计、回滚演练 | 安全/平台;失败不接生产 |
| 影子准入 | 生产输入、时效、分布、服务、人工流程、标签计划 | 业务/运营/风险;异常继续影子 |
| 灰度/扩展 | 业务护栏、客户影响、分群、人工积压和告警 | 委员会批准;越界降级/暂停 |
| 常态接管 | Runbook、值班、再验证、申诉、退役、成本与收益 | 业务/运行签收 |
生产监控分层:来源/特征质量与时效、训练/服务偏斜、漂移和新群体、预测/解释、延迟/错误、人工复核/推翻、真实结果与标签延迟、误报/漏报/校准、分群伤害和业务收益。每项定义测点、窗口、分母、基线、阈值、owner、频率、触发动作和证据。标签尚未成熟时明确使用代理监控但保留不确定性。
回滚演练覆盖模型/特征/阈值/源版本、服务路由、人工规则兜底、队列容量、已发建议/决定的更正及审计。新来源、特征、阈值、模型重训、用途/群体扩大都需影响评估、独立验证和灰度。性能/公平/用途持续不达标、源失去允许用途、人工兜底不可持续或收益不抵风险时暂停或退役;保留获批证据,按保留政策处置其他数据。
6. 工具与技术
- 统计计算、实验平台、特征/模型注册、训练与推理环境;
- 数据剖析、接入/对齐、质量、元数据/血缘、版本与审计;
- 批/流评分、服务网关、监控、灰度、规则兜底和人工复核;
- 可视化、报告与受控结果发布。
技术选型比较用途、数据结构/规模/速度、源可靠性、可复现、解释、延迟、成本、可访问性与运营技能。不要因“实时”或“大数据”标签接受不必要的复杂度;在满足业务时限和风险门的条件下选最简单可运行方案。
7. 指标、风险与实施
业务指标:相对基线的收益、避免损失、处理时长、人工容量、客户申诉、拒绝/漏放等。科学指标:样本/标签覆盖、独立集表现、校准、分群误差、置信、漂移、实验复现。运行指标:源到达、加载/扫描、服务可用/延迟/成本、告警和恢复。每项指标的目标由业务风险及基线确定,不能直接复用别的项目阈值。
关键风险:未经授权二次使用;不具代表性的样本;未来信息或实体泄漏;训练标签从模型旧决策反馈形成循环;代理特征带来差别损害;总体平均掩盖群体问题;数据源变化静默;图表筛选造成误导或重识别;人工把建议当命令;重训后未经批准自动上线;标签延迟使失效迟发现。
实施以假设和小范围实验开始,保留可停止的里程碑。六周窗口可只做已批准来源、辅助决策、影子/灰度和必要特征;范围不足时延后扩张,不跳过来源审查、独立评估、生产演练和人工接管。按计划发布结果、局限、未决风险和下一次验证时间。
8. 依赖与协同
handling-data-ethically:独立审查目的、受影响者、公平、代理、透明、申诉与伤害。securing-data:分类、用途/访问、保护、审计、输出再识别和事件处置。improving-data-quality:输入/标签质量、规则、画像、异常及源头修复。managing-metadata:来源、特征/标签/模型/图表的定义、版本、血缘和影响。integrating-data:接入、对齐、批流、重送、特征管道和对账。managing-reference-and-master-data:共享实体、标识、代码和层级解释。delivering-data-warehousing-and-bi:提供历史分析数据与受控 BI 消费;模型生命周期仍由本技能主导。operating-data-storage与designing-data-architecture:提供容量、恢复、平台和过渡边界。establishing-data-governance与leading-data-change:提供决策权、人工流程、培训和组织采纳。