DAMA DATA PROJECT SKILLSDOCUMENTATION · RELEASE 1.1.0

KNOWLEDGE LIBRARY V1.1.0

数据科学项目交付

核心原则

从可证伪的业务假设与可测收益出发,审查来源、用途和质量,反复探索、建模、验证、沟通并部署。模型的价值取决于独立测试、真实业务流程、允许的数据用途、生产表现和持续复核;离线分数只是证据之一。

适用边界

  • 预测/分类/聚类、推荐、异常检测、统计假设、实验、特征、训练/评估/部署/监控模型使用本技能。
  • 标准报表、已定义指标与分析仪表板由 delivering-data-warehousing-and-bi 主导;模型输出进入 BI 时协同。
  • 伦理、隐私与公平影响由 handling-data-ethically 主导独立审查;本技能把批准约束落实到来源、特征、评估、决策和监控。
  • 数据来源接入、存储和质量能力分别由集成、存储与质量技能提供;本技能指定科学有效性和可复现性要求。
  • 仅运行一次描述性查询、无假设检验或模型生命周期时按普通分析处理。

工作流

  1. 明确业务决策、行动、可证伪假设、对照/基线、成功/伤害指标、适用人群和人工/自动决策边界。
  2. 阅读数据科学项目手册,为每个来源记录必要性、来源/许可/允许用途、代表性、质量、更新、保留、连接、敏感性和输出再识别风险。
  3. 定义目标/标签、观察与预测时点、抽样/排除、泄漏防护、训练/验证/独立测试或实验设计;先冻结评估协议。
  4. 探索、集成、建特征、训练并与简单基线比较;保存数据快照、代码、环境、随机种子、参数、模型和结果。
  5. 评估准确/校准、误报/漏报成本、时间与群体稳健性、解释、偏差、资源/延迟和可用性;独立审查风险及限制。
  6. 用面向决策者的图表和解释呈现结果、置信度、适用范围与替代方案;记录业务选择和客户影响。
  7. 影子/灰度部署,监控输入质量、漂移、结果、延迟、标签反馈、群体影响与人工队列;设置暂停、回滚、再验证和退役门。

交付模板

使用 中文交付包English delivery pack 组织输出。叙述性方案和评审记录使用同目录 Word 模板;矩阵、台账和评分卡使用同目录 Excel 模板。模板中的责任、阈值、批准和证据须由实际项目确认。

输出契约

输出业务假设与决策边界;来源与用途论证;数据/特征/标签卡;实验与评估协议;可复现证据;模型卡和独立验证;可视化/沟通;生产服务与人工流程;监控、重训/变更、回滚和退役标准;阶段门、角色、风险、例外与验收证据。

常见错误

错误 修正
“离线准确率高”直接上线 检查基线、成本、校准、分群、生产输入和人工流程
用未来信息训练过去决策 固定预测时点、时间切分、特征可得性和泄漏测试
所有可获取数据都纳入 每源论证用途、可靠性、代表性、权限和增量价值
训练结果不可重现 固定数据/代码/环境/参数/种子/模型与评估版本
生产漂移只监控分布 同时监控结果、延迟标签、业务损害和群体影响
发布聚合图即无隐私风险 检查小群体、筛选组合与可重新识别输出
模型持续自更新无人批准 重训按变更、独立验证、灰度和回退执行