AI エージェント向け: ドキュメントインデックスは https://www.mongodb.com/ja-jp/docs/llms.txt で利用できます。すべてのページの markdown バージョンは、いずれかの URL パスに .md を追加することで利用できます。
Docs Menu

簡易アナライザ

simpleアナライザは、空白、句読点、1 桁以上の数字など、文字以外の文字を見つけた場合、テキストを検索可能なターム(トークン)に分割します。 すべてのテキストを小文字に変換します。

Refine Your Index を選択した場合、Atlas UI はIndex Configurations セクション内に View text analysis of your selected index configuration というタイトルのセクションを表示します。このセクションを展開すると、Atlas UI には、simpleアナライザが各サンプル列に対して生成するインデックスと検索トークンが表示されます。 Atlas UI Visual Editor でインデックスを作成または編集すると、simpleアナライザが組み込みサンプルドキュメントとクエリ文字列用に作成するトークンが確認できます。

重要

MongoDB Search は、アナライザトークンのサイズが 32766 バイトを超える、string フィールドのインデックスません。キーワードアナライザを使用している場合、32766 バイトを超える string フィールドはインデックス化されません。

次のインデックス定義の例では、simple アナライザを使用して、sample_mflix.movies コレクションの title フィールドにインデックスを指定します。この例に従うには、クラスターにサンプル データを読み込みmongosh を使用するか、または「MongoDB Search インデックスの作成」チュートリアルの手順に従って Atlas UI の Create a Search Index ページに移動します。

次に、movies コレクションをデータソースとして使用し、 または Atlasmongosh UIVisual Editor またはJSON editor からインデックスを作成する例の手順に従います。


次のクエリは、 titleフィールドでlionというタームを検索し、出力を 5 つの結果に制限します。

MongoDB Search では、lucene.simpleアナライザを使用して、titleフィールドのテキストに対して次の操作を実行してこれらのドキュメントが返されます。

  • テキストを小文字に変換します。

  • 文字以外の文字がある場合はテキストを分割して個別のトークンを作成します。

次の表は、MongoDB Search が Simple アナライザ を使用して結果の各ドキュメントに作成するトークンを示します。比較のため、表には Standard アナライザWhitespace アナライザ のトークンも示されています。

タイトル
簡易アナライザ トークン
標準アナライザ トークン
空白アナライザ トークン

White Lion

white, lion

white, lion

White, Lion

The Lion King

the, lion, king

the, lion, king

The, Lion, King

The Lion King 1 1/2

the, lion, king

the, lion, king, 1, 1, 2

The, Lion, King, 1, 1/2

Lion's Den

lion, s, den

lion's, den

Lion's, Den

MongoDB Search は、simple アナライザが lion の個別のトークンを作成し、それがクエリ期間 lion と一致するため、結果にドキュメント Lion's Den を返します。対照的に、Standard Analyzer または Whitespace Analyzer を使用してフィールドにインデックスを付ける場合、MongoDB Search は Lion's Den を返しません。標準アナライザはトークン lion's を作成し、空白アナライザLion's を作成しますが、どちらも lion のトークンは作成しません。