AnúncioApresentando MongoDB 8.0, o MongoDB mais rápido de todos os tempos! Leia mais >
AnúncioVoyage AI se junta ao MongoDB para impulsionar aplicativos de AI mais precisos e confiáveis no Atlas. Saiba mais >

Database Digest Vol. 2

Precisão em escala

Saiba como tornar os agentes sobre a sua base precisos, apresentando o recurso de uma prévia da produção da LG U+.

Baixe a revista

Fechando a lacuna de confiança

As alucinações são um problema de recuperação, não um problema de modelo. Comandos desatualizados ou imprecisos alimentam a confiança falsa dos agentes.

Pipelines rápidos, baratos e precisos

A recuperação em produção exige a resolução simultânea de precisão, latência e custo. Acertar a camada de dados garante que modelos de embedding, regras de quantização e estratégias de consulta componham de forma limpa sem forçar uma reestruturação dispendiosa da plataforma.

  • Truncar o tamanho do vetor por meio das regras de aprendizado do Matryoshka.
  • A quantização binária acelera as consultas em 60%.
  • A recuperação assimétrica reduz os custos do token em até 83%.
Leia o comunicado
Infográfico com o anúncio da versão 8.3 do MongoDB, mostrando melhorias de desempenho em comparação com a versão 8.0 de 10-2024. Ela destaca 35% a mais de taxa de transferência de gravar, 45% a mais de taxa de transferência de leitura e 15% a mais de taxa de transferência de transação.

As raízes arquitetônicas das alucinações

Quando um LLM inventa um ponto de dados, uma entidade ou uma política corporativa que realmente não existe, é quase sempre porque o pipeline de recuperação que alimenta o prompt era impreciso, obsoleto ou incompleto. Há um nome preciso para o espaço entre um sistema que retorna respostas básicas e um sistema cujas respostas podem ser utilizadas com confiança em produção: a lacuna de confiança.

Um agente raciocinando sobre o snapshot do cliente de ontem, ou um modelo de embedding que foi trocado sem reprocessar os registros subjacentes, cria um grande risco operacional. Não produz uma resposta visualmente incorreta; produz uma alucinação altamente confiante. Uma alucinação em uma única demonstração de sandbox é uma curiosidade, mas o mesmo erro aplicado a milhares de interações ao vivo por minuto é um incidente.

Apresentando a integridade contextual

A precisão é uma propriedade arquitetônica fundamental, melhor definida como integridade contextual: a disciplina de manter dados operacionais em tempo real, incorporações vetoriais, índices de pesquisa e estado do agente automaticamente consistentes, em vez de reconciliá-los manualmente posteriormente.

Quando essas quatro variáveis residem no mesmo registro subjacente servido exatamente pelo mesmo caminho de consulta, não há etapa de sincronização para que a precisão vaze. A recuperação que um agente recebe é fundamentada com segurança na verdade operacional do mesmo milissegundo em que foi emitida.

Os modelos da Voyage AI lideram o RTEB (Retrieval Embedding Benchmark), superando modelos comparáveis da Gemini, Cohere e OpenAI nas tarefas de RAG em empresas que os agentes realmente executam.

O MongoDB forneceu os blocos de construção necessários para preencher a lacuna de confiança nativamente dentro da camada de dados:

Grafo de linhas que compara a qualidade de recuperação em relação ao preço por milhão de tokens para modelos da Voyage AI. Ela mostra voyage-4, voyage-4-lite e voyage-4-nano alcançando pontuações de qualidade mais altas com a recuperação assimétrica em comparação com a recuperação simétrica e a voyage-3.5-lite. linha de base.

Adquira a habilidade: Voyage AI com MongoDB


Relatórios médicos baseados em IA

A unificação de dados de pacientes, anotações clínicas e literatura médica em um único pipeline ajuda a reduzir o esgotamento dos profissionais de saúde e os ciclos de documentação.
Fluxo de trabalho alimentado por IA mostrando upload de documento, definição de modelos, envio de solicitação para o LLM e geração estruturada de relatórios MDT a partir de documentos não processados.

Conheça a solução

A jornada dos construtores: principais regras de filtro

Para as equipes de engenharia que desejam superar a conversa conceitual, a implementação prática exige o exame da lógica de filtro real sob carga. Um exemplo importante é a pesquisa vetorial filtrada.

O MongoDB lida com isso aplicando um filtro por atributos (como ID do usuário) primeiro e, em seguida, executando a pesquisa vetorial. Por outro lado, os planejadores relacionais alternativos geralmente executam a pesquisa vetorial primeiro e tentam aplicar filtros depois. Quando os mecanismos relacionais pesquisam primeiro, os resultados altamente relevantes frequentemente saem do conjunto de avaliação de candidatos antes que eles possam ser pontuados. Esta pequena variação arquitetural tem consequências massivas na precisão ao dimensionar a produção de empresas.

Assista: A jornada do construtor: criando aplicativos de IA com o MongoDB

LG U+ mantém 3,5 milhões de consultas mensais

Os argumentos de arquitetura conceitual atingem um limite operacional muito claro quando uma empresa executa uma central de atendimento que recebe 3,5 milhões de atendimentos ao vivo de clientes por mês. A gigante coreana de telecomunicações LG U+ decidiu criar o Agent Assist: uma ferramenta interna inteligente que oferece a 4.000 agentes transcrição em tempo real, categorização automatizada de chamadas e resumos contextuais durante consultas ao vivo.

O banco de dados relacional legado simplesmente não poderia lidar com embedding vetoriais, dados transacionais e testes de query em tempo real simultaneamente no mesmo caminho de aplicação. Ao migrar os principais registros operacionais do Postgres, e consolidá-los no MongoDB Atlas, a equipe eliminou totalmente a camada de sincronização propensa a latência entre sistemas díspares. $vectorSearch executa algoritmos de similaridade semântica nativamente nas mesmas coleções de dados que agentes humanos realizam consultas para históricos de transações.

O serviço foi lançado apenas quatro meses após o início do desenvolvimento, mantendo latência de consulta de menos de um segundo mesmo durante os picos da manhã. O tempo em processamento por chamada diminuiu 7%, e a eficiência de recurso melhorou 30%. Inicialmente implantado para 1.200 agentes, o sistema agora lida com mais de um milhão de consultas por semana e está se expandindo para 2.300 agentes.

A lista de verificação de produção antes de enviar

O que a LG U+ demonstra é a lista de verificação completa que uma camada de dados deve entregar antes que um agente de produção possa ser confiável:

  1. Índices colocalizados: o índice de pesquisa de IA e os dados operacionais em tempo real devem residir exatamente no mesmo cluster de banco de dados, para que os agentes nunca recuperem dados de uma versão da verdade enquanto atuam em outra.
  2. Latência inferior a um segundo: Consultas semânticas devem ser executadas em menos de um segundo sob cargas elevadas, caso contrário, a resposta do agente chegará tarde demais para ser operacionalmente útil.
  3. Infraestrutura de dimensionamento automático: A plataforma deve dimensionar automaticamente para absorver picos de chamados matinais sem exigir que os engenheiros reprovisionem manualmente os nós.
  4. Flexibilidade do esquema: O modelo de dados subjacente deve se adaptar dinamicamente a diferentes formatos de conversação, sem exigir migrações rígidas do esquema sempre que a empresa realizar uma iteração.
Logotipo da LG U+
"O gerenciamento de dados vetoriais e operacionais no MongoDB abriu um novo mundo para a nossa equipe."
Minkyu Ha
Gerente Sênior de Engenharia de Software na LG U+

Impulsionar a transformação em IA

Digest do Banco de Dados

A camada de inteligência unificada: viabilizando a era agêntica

Simplifique a IA empresarial substituindo pilhas fragmentadas por dados unificados.

Baixe a revista

Índice