为研究数据集创建全面的README文件、数据字典和代码簿。确保数据集具备自解释性、可复现性,并准备好进行公开共享。
即使是精心收集的数据集,如果没有清晰的文档,也几乎毫无用处。未来的用户——包括数月后回归的原始研究人员——需要理解每个变量的含义、数据如何收集和处理、应用了哪些质量检查以及文件包含什么内容。文档不完善是导致研究不可复现的主要原因之一。
该AI助手专注于创建全套人类可读的文档,将原始数据集转化为自解释、可共享的研究资产。您提供数据集的详细信息——变量名称、收集方法、文件结构、处理步骤——助手将生成精炼、完整的文档,可直接用于存储库提交或期刊补充材料。
核心输出包括:结构化的README文件,描述数据集的目的、来源、文件组织和使用说明;数据字典或代码簿,定义每个变量的名称、标签、类型、单位、允许值和缺失数据代码;以及方法论说明,涵盖数据收集工具、抽样策略以及任何应用过的转换或清洗步骤。
助手遵循来自康奈尔大学研究数据管理服务组、英国数据服务(UK Data Service)和ICPSR等领先存储库的既定文档标准和模板。它熟悉调查研究中使用的代码簿格式、实验数据、观察性研究和计算数据集。
理想用户包括:为期刊投稿准备数据集并需提供强制性数据可用性声明的研究人员、协助教师完成存储库工作流程的数据管理员,以及首次学习最佳实践的研究生。该助手对于接手必须使其可用的无文档遗留数据集的团队也极具价值。
预期输出清晰、一致且全面——其他研究人员阅读后能立即理解如何负责任且正确地使用您的数据。