Progetta pipeline robuste per l'ingestione, la pulizia, l'aggiornamento e la sincronizzazione di dati eterogenei provenienti da fonti come PDF, wiki e database, trasformandoli in una knowledge base pronta per RAG.
Un Ingegnere di Ingestione della Knowledge Base aiuta a risolvere un problema pratico, spesso complesso, che si presenta prima che qualsiasi logica di recupero o generazione possa funzionare bene: trasformare i dati reali della tua organizzazione, nei formati incoerenti in cui attualmente esistono, in una forma pulita, strutturata e continuamente aggiornata che un sistema di retrieval-augmented generation possa utilizzare efficacemente. La conoscenza organizzativa reale raramente risiede in un unico formato ordinato; è sparsa tra PDF, documenti Word, wiki, fogli di calcolo, database interni, sistemi di ticketing e pagine web, spesso con formattazione incoerente, contenuti duplicati o obsoleti e metadati mancanti. Questo ruolo si concentra sulla progettazione della pipeline di ingestione che trasforma quel caos eterogeneo in input affidabile per il tuo sistema RAG. L'assistente lavora prima comprendendo il panorama dei tuoi dati, inclusi i formati delle fonti, la frequenza con cui i dati cambiano, se ci sono permessi di accesso o problemi di sensibilità, e quanto lavoro manuale di pulizia è attualmente richiesto. Successivamente, aiuta a progettare una pipeline che copre l'estrazione, che implica estrarre testo e struttura da formati come PDF, HTML e documenti Office preservando la struttura significativa come intestazioni e tabelle; la pulizia, che comporta la rimozione di boilerplate, la deduplicazione di contenuti quasi identici e la normalizzazione delle incoerenze di formattazione; l'arricchimento dei metadati, che implica allegare informazioni su fonte, autore, data e controllo degli accessi a ciascun contenuto in modo che possa essere filtrato e citato correttamente al momento del recupero; e la sincronizzazione, che mantiene aggiornata la knowledge base man mano che i documenti sorgente vengono aggiunti, aggiornati o eliminati, senza richiedere una reindicizzazione manuale completa ogni volta. Aspettati raccomandazioni pratiche sugli strumenti di estrazione adatti ai tuoi tipi di documenti specifici, strategie per rilevare e gestire contenuti duplicati o in conflitto tra le fonti, approcci all'aggiornamento incrementale in modo che la tua pipeline si adatti alla crescita dei dati, e indicazioni su come preservare il contesto critico come la gerarchia dei documenti o i riferimenti incrociati che l'estrazione di testo puro spesso scarta. L'assistente affronta anche le insidie comuni dell'ingestione, come PDF con estrazione di testo inaffidabile a causa di immagini scansionate o layout complessi, wiki con pagine obsolete che nessuno ha ripulito, e database dove le informazioni rilevanti sono sparse in molte tabelle normalizzate. I risultati del lavoro con questo ruolo includono tipicamente un progetto concreto di pipeline di ingestione, raccomandazioni di strumenti adatti alle tue fonti di dati effettive, e una strategia di sincronizzazione in modo che il tuo sistema RAG rimanga accurato man mano che i contenuti sottostanti cambiano. Questo ruolo è essenziale per le organizzazioni che costruiscono sistemi RAG su knowledge base interne reali piuttosto che su dataset puliti e curati, e per i team che hanno scoperto che i problemi di qualità dei dati, non quelli legati al modello o all'algoritmo di recupero, sono il vero collo di bottiglia per ottenere buone risposte.
Accedi con Google per accedere ai prompt professionali. I nuovi utenti ricevono 10 crediti gratuiti.
Accedi per sbloccare