---
name: delivering-data-science
description: Use when a project must test a data-driven hypothesis, develop or deploy a statistical or machine-learning model, combine new data sources for hypothesis testing, prediction, or model-based insight, or manage experiment validity, model evaluation, reproducibility, production monitoring, and retirement.
---

# 数据科学项目交付

## 核心原则

从可证伪的业务假设与可测收益出发，审查来源、用途和质量，反复探索、建模、验证、沟通并部署。模型的价值取决于独立测试、真实业务流程、允许的数据用途、生产表现和持续复核；离线分数只是证据之一。

## 适用边界

- 预测/分类/聚类、推荐、异常检测、统计假设、实验、特征、训练/评估/部署/监控模型使用本技能。
- 标准报表、已定义指标与分析仪表板由 `delivering-data-warehousing-and-bi` 主导；模型输出进入 BI 时协同。
- 伦理、隐私与公平影响由 `handling-data-ethically` 主导独立审查；本技能把批准约束落实到来源、特征、评估、决策和监控。
- 数据来源接入、存储和质量能力分别由集成、存储与质量技能提供；本技能指定科学有效性和可复现性要求。
- 仅运行一次描述性查询、无假设检验或模型生命周期时按普通分析处理。

## 工作流

1. 明确业务决策、行动、可证伪假设、对照/基线、成功/伤害指标、适用人群和人工/自动决策边界。
2. 阅读[数据科学项目手册](references/playbook.md)，为每个来源记录必要性、来源/许可/允许用途、代表性、质量、更新、保留、连接、敏感性和输出再识别风险。
3. 定义目标/标签、观察与预测时点、抽样/排除、泄漏防护、训练/验证/独立测试或实验设计；先冻结评估协议。
4. 探索、集成、建特征、训练并与简单基线比较；保存数据快照、代码、环境、随机种子、参数、模型和结果。
5. 评估准确/校准、误报/漏报成本、时间与群体稳健性、解释、偏差、资源/延迟和可用性；独立审查风险及限制。
6. 用面向决策者的图表和解释呈现结果、置信度、适用范围与替代方案；记录业务选择和客户影响。
7. 影子/灰度部署，监控输入质量、漂移、结果、延迟、标签反馈、群体影响与人工队列；设置暂停、回滚、再验证和退役门。

## 交付模板

使用 [中文交付包](templates/delivery-pack.zh.md) 或 [English delivery pack](templates/delivery-pack.en.md) 组织输出。叙述性方案和评审记录使用同目录 Word 模板；矩阵、台账和评分卡使用同目录 Excel 模板。模板中的责任、阈值、批准和证据须由实际项目确认。

## 输出契约

输出业务假设与决策边界；来源与用途论证；数据/特征/标签卡；实验与评估协议；可复现证据；模型卡和独立验证；可视化/沟通；生产服务与人工流程；监控、重训/变更、回滚和退役标准；阶段门、角色、风险、例外与验收证据。

## 常见错误

| 错误 | 修正 |
|---|---|
| “离线准确率高”直接上线 | 检查基线、成本、校准、分群、生产输入和人工流程 |
| 用未来信息训练过去决策 | 固定预测时点、时间切分、特征可得性和泄漏测试 |
| 所有可获取数据都纳入 | 每源论证用途、可靠性、代表性、权限和增量价值 |
| 训练结果不可重现 | 固定数据/代码/环境/参数/种子/模型与评估版本 |
| 生产漂移只监控分布 | 同时监控结果、延迟标签、业务损害和群体影响 |
| 发布聚合图即无隐私风险 | 检查小群体、筛选组合与可重新识别输出 |
| 模型持续自更新无人批准 | 重训按变更、独立验证、灰度和回退执行 |
