Para agentes de IA: um índice de documentação está disponível em https://www.mongodb.com/pt-br/docs/llms.txt — as versões de markdown de todas as páginas estão disponíveis anexando .md a qualquer caminho de URL.
Menu Docs

Analisador padrão

O analisador standard é o padrão para todos os índices e consultas do MongoDB Search. Ele divide o texto em termos com base nos limites das palavras, o que o torna neutro em termos de linguagem para a maioria dos casos de uso. Converte todos os termos em minúsculas e remove a pontuação. Ela fornece tokenização baseada em gramática que reconhece endereços de e-mail, acrônimos, caracteres chinês-japonês-coreanos, alfanuméricos e muito mais.

Se você selecionar Refine Your Index, a UI do Atlas exibirá uma seção intitulada View text analysis of your selected index configuration dentro da seção Index Configurations. Se você expandir essa seção, a UI do Atlas exibirá o índice e os tokens de pesquisa que o analisador standard gera para cada string de amostra. É possível ver os tokens que o analisador standard cria para um documento de amostra integrado e uma cadeia de query quando você cria ou edita um índice na UI do Atlas Visual Editor.

Importante

O MongoDB Search não indexará campos de string em que os tokens do analisador excedam 32766 bytes de tamanho. Se estiver usando o analisador de palavras-chave, os campos de string que excederem 32766 bytes não serão indexados.

A seguinte definição de índice de exemplo especifica um índice no campo title na coleção sample_mflix.movies utilizando o analisador standard. Para acompanhar este exemplo, carregue os dados de amostra no seu cluster e use mongosh ou navegue até a página Create a Search Index na IU do Atlas seguindo as etapas do tutorial Criar um índice de pesquisa do MongoDB.

Em seguida, usando a movies collection como sua fonte de dados, siga o procedimento de exemplo para criar um índice a partir de ou da UI do mongosh Atlas Visual Editor JSON editorou.


➤ Use o menu suspenso Selecione seu idioma para definir a interface para o exemplo nesta página.


A query a seguir procura o campo title em busca do termo action e limita a saída a dois resultados.

O MongoDB Search retornou esses documentos porque fez a correspondência entre o termo de query action e o token action para os documentos, que o MongoDB Search criou fazendo o seguinte para o texto no campo title usando o analisador lucene.standard :

  • Converta o texto em minúsculas.

  • Divida o texto com base nos limites das palavras e crie tokens separados.

A tabela a seguir mostra os tokens (termos pesquisáveis) que o MongoDB Search cria usando o Analisador Padrão e, por outro lado, os tokens que o MongoDB Search cria para o Analisador de Palavra-chave e o Analisador de Espaço em Branco para os documentos nos resultados:

Título
Tokens de analisador padrão
Tokens do analisador de palavras-chave
Tokens do analisador de espaço em branco

Action Jackson

action, jackson

Action Jackson

Action, Jackson

Class Action

class, action

Class Action

Class, Action

Se você indexar o campo utilizando o:

  • Analisador de palavras-chave, a pesquisa do MongoDB não corresponderia aos documentos nos resultados do termo de query action porque o analisador de keyword corresponde apenas a documentos nos quais o termo de pesquisa corresponde a todo o conteúdo do campo (Action Jackson e Class Action) exatamente.

  • Whitespace Analyzer, a MongoDB Search não corresponderia aos documentos nos resultados do termo de consulta action porque o analisador whitespace tokeniza o valor do campo title em seu caso original (Action) e o termo de consulta tem as letras minúsculas action, que não corresponde ao token do analisador whitespace.

Nesta página