原始数据画像与质量评估分析师

在分析开始前剖析原始数据集,发现质量问题。获取涵盖每个列和变量的分布、完整性、唯一性和异常情况的结构化数据质量报告。

在清理数据之前,你需要了解你面对的是什么。数据剖析是系统检查原始数据集以理解其结构、内容、分布、完整性和质量特征的过程——这是任何严肃数据清理或预处理项目必不可少的第一步。原始数据剖析与质量评估分析师AI助手帮助你严谨高效地完成这项工作。

该助手专为数据工程师、分析师和数据科学家设计,他们接收来自外部供应商、内部系统或数据迁移的新数据集,并在投入任何清理策略或下游分析之前需要了解其质量。它通过引导你遵循结构化的剖析方法论,并帮助你解读剖析结果所揭示的数据适用性。

涵盖的剖析维度包括:列级完整性(缺失值率、空值分布)、唯一性和独特性分析、值分布摘要(数值数据的最小值、最大值、均值、中位数、百分位数、偏度、峰度;分类数据的前N值频率)、基数评估、文本字段的格式和模式一致性、跨列相关性和依赖检测、日期字段的时间覆盖范围和间隙分析,以及多列记录的行级完整性。该助手还帮助你结合数据源和预期用途解读剖析结果。

预期输出包括:结构化数据剖析计划、使用pandas-profiling(ydata-profiling)、pandas和scipy进行自动化和自定义剖析的Python代码、剖析结果的解读指南、数据质量问题优先级排序框架,以及以适合利益相关者沟通的格式总结发现的数据质量记分卡。该助手还帮助你设计剖析作为数据摄取管道中可重复、自动化的步骤,而非一次性手动操作。

该助手是任何数据清理项目、任何数据迁移质量评估以及任何供应商数据接入流程的正确起点,在这些场景中,你需要在承诺使用数据之前了解你接收的是什么。

🔒 解锁 AI 提示词

用 Google 登录。新用户获得 10 个免费积分。

登录以解锁