AnnuncioTi presentiamo MongoDB 8.0, il MongoDB più veloce di sempre! Leggi >
AnnuncioVoyage AI si unisce a MongoDB per potenziare applicazioni AI più accurate e affidabili su Atlas. Scopra di più >

Database Digest vol. 2

Precisione su scala

Scopri come rendere precisi gli agenti basati sulla tua fondazione, presentando una funzionalità di produzione di LG U+.

Scarica la rivista

Colmare il divario di fiducia

Le allucinazioni sono un problema di recupero, non un problema di modello. Prompt obsoleti o imprecisi alimentano una falsa fiducia dell'agente.

Pipeline veloci, economiche e precise

Il recupero in produzione richiede di risolvere simultaneamente precisione, latenza e costi. Un corretto layer di dati garantisce che i modelli di embedding, le regole di quantizzazione e le strategie di query si compongano in modo pulito senza costringere a una costosa sostituzione della piattaforma.

  • Tronca la dimensione del vettore tramite regole di apprendimento Matrioska.
  • La quantizzazione binaria accelera le query del 60%.
  • Il recupero asimmetrico riduce i costi dei token fino all'83%.
Leggi annuncio
Infografica che annuncia la versione 8.3 di MongoDB, che mostra i miglioramenti delle prestazioni rispetto alla versione 8.0 di ottobre 2024. Evidenzia un aumento del 35% di rendimento di scrittura, del 45% di rendimento di lettura e del 15% di rendimento di transazione.

Le radici architettoniche delle allucinazioni

Quando un LLM inventa un punto di dato, un'entità o una politica aziendale che in realtà non esiste, è quasi sempre perché la pipeline di recupero che forniva il prompt era imprecisa, obsoleta o incompleta. Esiste un termine preciso per indicare il divario tra un sistema che fornisce risposte di base e un sistema le cui risposte possono essere utilizzate con sicurezza in un ambiente di produzione: il divario di fiducia.

Un agente che ragiona sulla base dello snapshot del cliente di ieri, o un modello di embedding che è stato sostituito senza rielaborare i record sottostanti, crea un grave rischio operativo. Non produce una risposta visibilmente sbagliata; produce un'allucinazione con elevata certezza. Un'allucinazione in una singola demo in sandbox è una curiosità, ma lo stesso errore applicato a migliaia di interazioni live al minuto è un incidente.

Introduzione dell'integrità contestuale

L'accuratezza è una proprietà architettonica fondamentale meglio definita come integrità contestuale: la disciplina di mantenere automaticamente coerenti i dati operativi in tempo reale, gli embedding vettoriali, gli indici di ricerca e lo stato dell'agente anziché riconciliarli manualmente a posteriori.

Quando queste quattro variabili risiedono nello stesso record sottostante, fornito dallo stesso percorso di query, non vi è alcuna fase di sincronizzazione attraverso la quale possa verificarsi una perdita di accuratezza. Le informazioni che un agente riceve sono saldamente ancorate alla realtà operativa del millisecondo esatto in cui sono state emesse.

I modelli di Voyage AI sono in testa al Retrieval Embedding Benchmark (RTEB), superando modelli comparabili di Gemini, Cohere e OpenAI nelle attività RAG aziendali effettivamente eseguite dagli agenti.

MongoDB ha fornito gli elementi fondamentali necessari per colmare nativamente il divario di fiducia all'interno del layer dati:

Grafico lineare che mette a confronto la qualità del recupero con il prezzo per milione di token per i modelli di Voyage AI. Mostra che voyage-4, voyage-4-lite e voyage-4-nano ottengono punteggi di qualità più elevati con il recupero asimmetrico rispetto al recupero simmetrico e al riferimento di voyage-3.5-lite.

Acquisisci competenza: Voyage AI con MongoDB


Rapporti medici basati sull'AI

L'integrazione dei dati dei pazienti, delle note cliniche e della letteratura medica in un unico flusso di lavoro contribuisce a ridurre il burnout del personale clinico e gli iter burocratici.
Flusso di lavoro basato sull'AI che mostra il caricamento di documenti, la definizione del modello, la sollecitazione LLM e la generazione di report MDT strutturati da documenti non elaborati.

Esplora la soluzione

Il percorso dello sviluppatore: regole di filtraggio di base

Per i team di ingegneri che intendono andare oltre le semplici discussioni teoriche, l'implementazione pratica richiede l'analisi della logica di filtraggio effettiva in condizioni di carico. Un esempio chiave è la ricerca vettoriale filtrata.

MongoDB gestisce questa operazione filtrando prima in base agli attributi (come l'ID utente) e poi eseguendo la ricerca vettoriale. Al contrario, i pianificatori relazionali alternativi spesso eseguono prima la ricerca vettoriale e tentano di applicare i filtri in seguito. Quando il motore di ricerca relazionale effettua prima una ricerca, i risultati altamente pertinenti spesso vengono esclusi dal set di valutazione dei candidati prima ancora di poter essere valutati. Questa piccola variazione architettonica ha enormi conseguenze sulla precisione a livello di produzione aziendale.

Da non perdere: Il percorso dello sviluppatore: creazione di applicazioni AI con MongoDB

LG U+ registra 3,5 milioni di consultazioni mensili

Gli argomenti di architettura concettuale raggiungono un chiaro limite operativo quando un'azienda gestisce un call center che riceve 3,5 milioni di richieste dei clienti al mese. Il colosso coreano delle telecomunicazioni LG U+ si è proposto di sviluppare Agent Assist: uno strumento interno intelligente che offre a 4.000 agenti umani trascrizioni in tempo reale, categorizzazione automatica delle richieste e riassunti contestuali durante le consultazioni dal vivo.

Il loro vecchio relational database non era in grado di gestire simultaneamente vettori di embedding, dati transazionali e test di query in tempo reale all'interno dello stesso percorso applicativo. Migrando i registri operativi core da Postgres e consolidandoli su MongoDB Atlas, il team eliminò completamente il layer di sincronizzazione soggetto a latenza tra sistemi disparati. $vectorSearch esegue algoritmi di similarità semantica in modo nativo sulle stesse identiche tabelle di dati che gli operatori umani interrogano per ottenere la cronologia delle transazioni.

Il servizio è stato lanciato appena quattro mesi dopo l'inizio dello sviluppo, mantenendo una latenza di query inferiore al secondo anche durante i picchi di traffico mattutini. Il tempo di elaborazione per chiamata è diminuito del 7%, mentre l'efficienza delle risorse è migliorata del 30%. Inizialmente progettato per 1.200 agenti, il sistema gestisce ora oltre un milione di richieste a settimana ed è in fase di scalabilità verso 2.300 agenti.

La checklist di produzione prima della spedizione

Ciò che LG U+ dimostra è l'elenco assoluto di requisiti che un layer dati deve soddisfare prima che un agente di produzione possa essere considerato affidabile:

  1. Indici co-localizzati: l'indice di ricerca AI e i dati operativi in tempo reale devono risiedere nello stesso esatto cluster di database; così gli agenti non recuperano mai da una versione della verità mentre agiscono su un'altra.
  2. Latenza inferiore al secondo: le query semantiche devono essere eseguite in meno di un secondo sotto carichi pesanti, altrimenti la risposta dell'agente arriva troppo tardi per essere operativamente utile.
  3. Infrastruttura a scalabilità automatica: la piattaforma deve scalare automaticamente per assorbire i picchi di chiamate mattutine senza richiedere agli ingegneri di effettuare un nuovo provisioning manuale dei nodi.
  4. Flessibilità dello schema: il modello di dati sottostante deve adattarsi dinamicamente a varie forme di conversazione senza imporre rigide migrazioni di schemi ogni volta che un'azienda esegue un'iterazione.
Logo LG U+
"La gestione dei dati vettoriali e operativi in MongoDB ha aperto un nuovo mondo per il nostro team."
Minkyu Ha
Responsabile senior dell'ingegneria del software presso LG U+

Guida la trasformazione dell'AI

Database Digest

The Unified Intelligence Layer: alimentando l'era agentica

Semplifica l'AI aziendale sostituendo gli stack frammentati con dati unificati.

Scarica la rivista

Sommario