# 数据处理伦理项目手册

## 1. 业务驱动与目标

伦理数据处理的目标不是阻止数据创造价值，而是确保价值的取得不以不透明、操纵、歧视、失真或不成比例的伤害为代价。主要驱动包括：

- 维护客户、员工、合作方和公众的信任；
- 避免数据误用、误解、虚假呈现和不可逆伤害；
- 在法律未覆盖或落后于技术时维持负责任判断；
- 确保数据与分析结果足够准确、完整、及时且可解释，能够支持其用途；
- 明确谁可从数据经济价值中受益、谁承担风险、谁有权质疑。

成功状态是：每个高影响用途有明确目的、受影响方、可替代方案、批准边界、可验证控制、申诉/纠正路径和持续复核，而不是只有一份原则声明。

## 2. 原则与关键概念

| 原则 | 项目判断问题 |
|---|---|
| 尊重个人（Respect for Persons） | 人是否被当作有自主权的主体？目的和后果是否可理解？能否选择、访问、更正、反对或申诉？弱势或低自主群体是否得到额外保护？ |
| 利益与不伤害（Beneficence / Non-maleficence） | 收益是否真实且可验证？是否存在侵入更小、数据更少或影响更轻的替代方案？谁可能受物质、机会、声誉、心理或群体伤害？ |
| 公平正义（Justice） | 相似情形是否受到相似待遇？收益、错误、监控和举证负担是否不成比例地落在某些群体？训练、抽样或规则是否复制历史偏见？ |
| 法律与公共利益（Respect for Law and Public Interest） | 是否符合适用法律、专业规范和社会期望？即使合法，是否破坏公共信任或造成难以纠正的权力不对称？ |
| 可信与透明 | 数据来源、质量、转换、限制和利益冲突是否可追溯？呈现是否选择性省略、操纵尺度、夸大因果或隐藏不确定性？ |

隐私相关原则包括目的明确、收集限制、数据最小化、质量/准确性、使用限制、安全保障、开放透明、个人参与、问责和适当保留。具体法律义务随地区变化，必须另行核对。

关键区别：

- **安全** 防止未授权访问或破坏；**伦理** 还判断已授权行为是否应当发生。
- **匿名化/掩码** 是控制，不是伦理许可；多源拼接仍可能重识别。
- **同意** 是一种依据，不自动消除操纵、歧视、质量或权力不对称问题。
- **高准确率** 不证明公平、合宜或无伤害。

## 3. Plan / Control / Develop / Operate

### Plan

1. 写出单一、具体、可验证的用途声明和不允许用途。
2. 记录必要性：若不处理这些数据会怎样；比较数据更少、侵入更低、人工或聚合替代方案。
3. 绘制数据旅程：来源、采集情境、派生/推断、组合、使用决策、共享、保留和处置。
4. 识别直接、间接、未参与但受影响的群体；分析权力、可选择性和申诉能力。
5. 建立收益/伤害假设、不确定性和证据计划。

### Control

1. 指定业务用途批准者、数据所有者、伦理/隐私/法律审查者和独立升级路径。
2. 将允许用途、禁止用途、访问、共享、保留、质量和透明要求写成可执行政策/数据契约。
3. 对高影响决定设置人工复核、可解释理由、申诉、更正和事件处置。
4. 每项例外记录范围、风险、批准人、到期日、补救和撤销条件。

### Develop

1. 在设计中落实最小化、分离、聚合、隐私保护、质量校验、血缘和审计。
2. 用代表性数据测试错误、缺失、重识别、代理变量、群体差异、最坏用途和恶意内部使用。
3. 验证通知/解释能被目标人群理解，且拒绝或申诉不会产生不合理惩罚。
4. 通过“影子/只观察”或小范围试点比较预期与真实影响；高风险用途不得只做技术 UAT。

### Operate

1. 监控实际用途、结果、群体差异、投诉、纠正、访问、下游共享和用途漂移。
2. 定期确认数据仍准确、必要、最新，原批准目的和责任人仍有效。
3. 发现用途外使用、严重伤害、不可解释差异或失去合法/伦理依据时暂停处理并保全证据。
4. 按到期日重新批准、缩小用途、删除数据或退役处理流程；将事件纳入文化和培训改进。

## 4. 上下文与角色

| 角色 | 责任与决策权 |
|---|---|
| 业务用途负责人 | 证明业务需要、替代方案和价值；对用途边界与实际结果负责，不能把责任转给技术团队 |
| 数据所有者/数据管家 | 说明来源、含义、质量、允许使用、共享和保留；可暂停不可信或越界数据 |
| 数据治理机构 | 批准原则、政策、例外、升级和跨域争议；确保决定可审计 |
| 隐私/法律/合规 | 判断适用义务和权利；对未解决法律风险给出阻止或附条件意见 |
| 伦理或独立风险审查 | 代表受影响方、检验利益冲突与公共利益；可要求重设或停止高影响用途 |
| 安全、架构、工程、分析/数据科学 | 将用途和伦理条件实现为控制、数据质量、血缘、测试、解释和监控 |
| 变更与培训负责人 | 建立安全发声、无报复升级、培训和持续文化机制 |
| 受影响方或代表 | 提供体验、可理解性、伤害、选择和申诉证据；不应只在上线后被动接收通知 |

重大用途的 Go/No-go 不能由从上线直接获益的单一团队独自批准。冲突升级路径必须允许员工停止或报告潜在不道德做法而不受报复。

## 5. 交付物与验收证据

### 伦理影响评估

```markdown
# 数据伦理影响评估
- 具体目的与预期决策：
- 数据来源、收集情境、派生和组合：
- 允许用途 / 禁止用途：
- 必要性及更低侵入替代方案：
- 受影响方、弱势群体和代表参与：
- 尊重个人：选择、理解、更正、反对、申诉：
- 收益与伤害：严重性、概率、可逆性、承担者：
- 公平：群体收益/错误/负担及阈值：
- 可信：质量、血缘、限制、透明和呈现：
- 控制、测试、证据位置与责任人：
- 未确定事项、例外与到期日：
- 决定：推进 / 附条件推进 / 暂停重设 / 停止：
- 监控、复核和停止触发器：
```

| 交付物 | 最低验收证据 |
|---|---|
| 用途与数据旅程 | 每个输入和派生数据可关联具体用途、来源、共享方、保留和处置；用途外行为能被检测 |
| 受影响方与参与记录 | 不只列客户；包含员工、非用户、下游群体和弱势方，并记录其意见如何改变设计 |
| 收益/伤害与替代方案 | 对严重性、概率、分配和可逆性有证据；至少比较一个更少数据或更低影响方案 |
| 公平与质量测试 | 规则、样本、分群、阈值和限制已批准；结果可重复，失败有明确动作 |
| 透明、选择与申诉 | 目标人群理解测试、可执行选择/更正/申诉流程和处理 SLA 通过演练 |
| 决策与例外记录 | 批准人具备权限且不存在未披露利益冲突；条件、到期日和停止触发器完整 |
| 运营监控 | 仪表板、投诉/事件、用途漂移、下游共享和复核日历有责任人与运行记录 |

## 6. 工具与技术

- **数据旅程与血缘图：** 发现来源、推断、共享、跨境、重识别和处置风险。
- **利益相关者/权力图：** 不只按“受益者”分类，还识别无法退出、难以申诉和承担外部性的人。
- **误用与伤害案例：** 同时测试预期用户犯错、内部滥用、下游再利用和对抗者拼接。
- **比例性/必要性测试：** 对每类数据问“没有它能否达成目的”“是否能聚合、缩短保留或延后采集”。
- **分群和反事实测试：** 比较不同群体的覆盖、错误、成本、机会和人工推翻；检查代理变量。
- **可理解性测试：** 让目标人群用自己的话解释目的、数据、决定和申诉，不以发布隐私条款代替理解。
- **红队与预演失败（pre-mortem）：** 假设一年后造成伤害或丑闻，反推早期信号和停止条件。
- **数据呈现审查：** 检查选择性时间窗、缺失点、尺度、因果暗示、样本偏差和不确定性披露。

工具选择服从问题和证据，不以购买“AI 伦理平台”代替所有权、参与和决策。

## 7. 指标、风险与实施

指标至少覆盖：

- **过程：** 高影响用途评估覆盖率、附条件项按期关闭率、例外逾期数、受影响方参与率；
- **数据/模型：** 质量阈值、重识别测试、群体错误/收益/负担差异、解释缺失率、人工推翻率；
- **权利与信任：** 选择/退出、访问更正、申诉量与处理时长、投诉主题、满意/理解度；
- **运营：** 用途外访问/共享、保留超期、未批准数据源、伦理事件、暂停/退役执行时间；
- **结果：** 预期收益是否实现、伤害是否出现、收益和负担如何分布。

指标不应鼓励压低投诉或退出。投诉增加可能表示渠道更可达；结合严重性、重复性和解决质量解释。

常见实施风险：只做合规勾选；审查过晚；原则无阈值；由项目团队自批；把匿名化当终局；忽略数据质量和误导性呈现；只测试平均值；审批后用途悄然扩张。以阶段门、独立审查、可执行控制和运营复核应对。

停止或立即升级的典型条件：发现未批准用途/数据；无法说明高影响决定；可信的严重不公平或伤害证据；重识别或泄露；受影响方无法行使必要权利；关键质量/血缘丢失；例外到期仍未补救。

## 8. 依赖与协同

- `establishing-data-governance`：把伦理原则转成决策权、政策、例外和监督。
- `securing-data`：实现分类、访问、加密、审计、事件和第三方控制。
- `managing-metadata`：记录用途、来源、血缘、敏感性、所有者、保留与限制标签。
- `improving-data-quality`：验证数据是否足以支持用途，避免失真和误导。
- `delivering-data-science`：将伦理/公平条件嵌入假设、实验、模型、部署、监控和退役。
- `leading-data-change`：建立培训、安全发声、无报复升级和伦理文化。
- `managing-documents-and-content`：当隐私通知、同意、政策或内容保留本身是治理对象时协同。

法律义务或行业标准存在时，以当前权威来源为准；伦理评估解释法律未穷尽的判断，不修改法律结论。
