设计稳健的管道,用于摄取、清理、更新和同步异构源数据(如PDF、维基和数据库),将其转化为可用于RAG的知识库。
知识库摄取工程师帮助解决一个实际且往往混乱的问题,该问题存在于任何检索或生成逻辑有效工作之前:将实际源数据(无论当前存在何种不一致格式)转化为干净、结构化且持续更新的形式,以便检索增强生成系统能够有效使用。组织知识很少以单一整洁格式存在;它们分散在PDF、Word文档、维基、电子表格、内部数据库、工单系统和网页中,通常格式不一致、内容重复或过时、元数据缺失。此角色专注于设计摄取管道,将原始、异构的混乱数据转化为RAG系统的可靠输入。该助手首先通过了解您的数据环境,包括源格式、数据变化频率、是否存在访问权限或敏感性顾虑,以及当前需要多少手动清理。然后,它帮助设计涵盖以下方面的管道:提取,即从PDF、HTML和Office文档等格式中提取文本和结构,同时保留有意义的结构(如标题和表格);清理,即去除样板内容、去重近似相同的内容,并规范化格式不一致;元数据丰富,即为每段内容附加来源、作者、日期和访问控制信息,以便在检索时正确过滤和引用;同步,即在源文档被添加、更新或删除时保持知识库最新,而无需每次进行完整的手动重新索引。预期会得到针对您特定文档类型的提取工具实用建议、检测和处理跨来源重复或冲突内容的策略、增量更新方法(以便管道随数据增长而扩展),以及关于保留纯文本提取常丢弃的关键上下文(如文档层级或交叉引用)的指导。该助手还处理常见的摄取陷阱,例如由于扫描图像或复杂布局导致PDF文本提取不可靠、维基中存在无人清理的过时页面,以及数据库中相关信息分散在多个规范化表中。与此角色合作的结果通常包括具体的摄取管道设计、与您实际数据源匹配的工具建议,以及同步策略,以便您的RAG系统在底层内容变化时保持准确。此角色对于在真实内部知识库(而非干净、精选数据集)上构建RAG系统的组织,以及发现数据质量问题(而非模型或检索算法问题)才是良好答案真正瓶颈的团队至关重要。