跳转到主要内容

数据清理(Clean Data XLS)

什么是数据清理?

在金融分析中,“干净的数据”是一切分析的前提。现实中,从各种来源获取的原始数据往往存在各种质量问题:多余的空格、不一致的大小写(USA vs usa vs Usa)、数字被存为文本(Excel 左上角的绿色三角形)、日期格式混乱(2024/3/8 vs March 8, 2024 vs 2024-03-08)、重复行等等。 如果不先清理这些问题就直接做分析,结果可能完全不可靠 —— 比如 VLOOKUP 因为前导空格而匹配失败,或者 SUM 因为部分数字被存为文本而漏算。 这个技能检测数据中的各种质量问题,提出修复建议,并在用户确认后执行清理 —— 尽可能使用公式(保持透明和可审计),而非直接覆盖原始数据。

为什么重要

  • Comps 分析数据整合 —— 从多个来源合并的公司数据需要统一格式
  • M&A 数据室清理 —— 尽职调查中获取的原始数据往往格式混乱
  • 财务模型输入 —— 垃圾数据进去就是垃圾结果出来
  • 报告生成 —— 输出格式的一致性影响专业形象

核心概念

工作流程

1

确定范围

  • 如果指定了范围(如 A1:F200),使用该范围
  • 否则使用活动工作表的全部已用区域
  • 分析每列的主要数据类型(文本/数字/日期),识别异常值
2

检测问题

在提出任何修复建议之前,先扫描所有问题类型:
3

提出修复建议

展示汇总表,修改前必须获得用户确认
4

执行修复

按类别逐一执行,每个类别完成后与用户确认:
  1. 空白字符 → 展示前后对比 → 确认
  2. 大小写 → 展示前后对比 → 确认
  3. 数字转换 → 展示前后对比 → 确认
  4. 日期标准化 → 展示前后对比 → 确认
  5. 去重 → 展示将删除的行 → 确认

核心原则:公式优于覆盖

尽可能使用公式(在辅助列中),而不是直接覆盖原始数据。 这保持了数据转换的透明性和可审计性。 仅在以下情况直接覆盖:
  • 用户明确要求
  • 没有合理的公式替代方案(如编码/乱码修复)

如何添加到本地环境

针对中文数据的定制:

最佳实践

  • 先检测后修复 —— 在修改任何内容之前,先展示完整的问题清单
  • 分类别逐步执行 —— 不要一次性修改所有问题
  • 绝不在未经确认的情况下删除重复行 —— 错误的去重可能不可逆地损毁数据
  • 近似重复需要人工判断 —— “Apple Inc.” vs “APPLE INC” 是同一家公司吗?