Puedes explorar e implementar modelos de Voyage AI by MongoDB desde Model Garden en Gemini Enterprise Agent Platform, anteriormente conocida como GCP Vertex AI.
Model Garden gestiona las licencias de modelos de IA de Voyage AI by MongoDB y proporciona opciones de implementación utilizando hardware on-demand o tus reservas existentes de Compute Engine.
Los modelos Voyage AI de MongoDB son modelos de socios autogestionados, lo que significa que pagas tanto por el uso del modelo como por la infraestructura de Gemini Enterprise Agent Platform que consumes. Gemini Enterprise Agent Platform gestiona la implementación y proporciona funcionalidades de gestión de endpoints.
Modelos disponibles
Para ver qué modelos puede implementar, busque "Voyage" en el Model Garden de Gemini Enterprise Agent Platform.
Para obtener más información sobre los modelos de Voyage AI, consulte la descripción general de los modelos de incrustación y reclasificación de Voyage AI.
Precios
El precio de los modelos de Voyage AI by MongoDB en Model Garden en Gemini Enterprise Agent Platform incluye:
Tarifa de uso del modelo: Un costo por utilizar el contenedor del modelo IA de Voyage, facturado a una tarifa por hora. La tarifa de uso depende del modelo específico y de la configuración de hardware que elijas para la implementación. Para obtener información detallada sobre precios, consulta la sección de precios en la página de listado del modelo en Google Cloud Marketplace.
Instancia subyacente de Google Cloud en tu región: El costo de la instancia de GPU subyacente de Google Cloud, como NVIDIA L4, A100, o H100, que es específica de una región, se factura mensualmente y se cobra por vCPU. Para aprender más, consulte Precios de Google Cloud Compute Engine.
Todos los cargos de facturación aparecen como el uso de Gemini Enterprise Agent Platform en su factura de Google Cloud Platform.
Para ver el precio de un modelo específico de Voyage IA:
Ve a Model Garden.
Quotas
Al implementar modelos de Voyage AI, consume recursos de Gemini Enterprise Agent Platform que están sujetos a cuotas. Puede ver y administrar sus cuotas en la Quotas sección de la página de IAM de la consola de Google Cloud. Para obtener más información, consulte Ver las cuotas de su proyecto. En la misma página, puede hacer clic con el botón derecho en cualquier cuota actual, seleccionar Edit quota y enviar una solicitud para aumentarla si es necesario.
Requisitos previos
Para empezar a usar los modelos Voyage AI de MongoDB a través de la plataforma de agentes empresariales Gemini, debes:
Configura un proyecto de Google Cloud y un entorno de desarrollo. Para obtener instrucciones, consulta Configura tu proyecto y entorno de desarrollo.
Habilite la API de la plataforma Gemini Enterprise Agent. Para obtener instrucciones, consulte la sección Configuración.
Configuración de hardware
Cada modelo de Model Garden enumera su configuración de hardware recomendada. Consulte Model Garden en Gemini Enterprise Agent Platform para conocer las especificaciones de hardware recomendadas de cada modelo de Voyage.
Por ejemplo, para el modelo voyage-4, utiliza las siguientes instancias recomendadas que Model Garden en la plataforma de agentes empresariales de Gemini sugiere para la implementación. Estas recomendaciones pueden cambiar y te recomendamos que consultes la página oficial de Model Garden en la plataforma de agentes empresariales de Gemini para un modelo de Voyage AI en particular para ver su hardware recomendado.
Las instancias A2 , tales como
a2-highgpu-1goa2-ultragpu-1g, con GPUs A100 son la opción por defecto.Se recomienda A3 instancias, como
a3-highgpu-1g, con GPUs H100 para necesidades de mayor rendimiento.
Regiones admitidas
Model Garden enumera las regiones compatibles para cada modelo de Voyage IA. Si necesitas soporte en otra región para cualquiera de los modelos, contacta soporte de MongoDB.
Mejores prácticas y limitaciones
Tipo de endpoint: Todos los modelos de Voyage IA requieren un tipo de endpoint público dedicado. Para obtener más información, consulta Elige un tipo de endpoint.
Comprenda input_type: query vs. Documento: El parámetro
input_typeoptimiza las incrustaciones para tareas de recuperación. Utiliza"query"para consultas de búsqueda y"document"para el contenido que se está buscando. Esta optimización mejora la precisión de la recuperación. Para aprender más sobre el parámetroinput_type, consulta la Visión general de la API de incrustación y renacionalización.Usar diferentes dimensiones de salida: los modelos Voyage 4 admiten múltiples dimensiones de salida: 256, 512, 1024 (por defecto) y 2048. Las dimensiones más pequeñas reducen los costos de almacenamiento y computación, mientras que las dimensiones más grandes pueden proporcionar una mejor precisión. Elige la dimensión que mejor equilibre tus requisitos de precisión con las limitaciones de recursos.
Ubique los Modelos Voyage IA
Para encontrar los modelos de Voyage AI by MongoDB en el Model Garden:
Go a Model Garden.
Ve a la consola de Model Garden.
Busca modelos de Voyage.
En el campo Search Models, ingresa "Voyage" para mostrar la lista de modelos Voyage IA de MongoDB.
Nota
El Google Cloud Marketplace tiene dos cuadros de búsqueda: uno para todo el Marketplace y otro dentro de Model Garden en Gemini Enterprise Agent Platform. Para localizar los modelos de Voyage AI by MongoDB, utilice el cuadro de búsqueda en Model Garden en Gemini Enterprise Agent Platform.
Alternativamente, puedes navegar a los modelos de Voyage IA a través de Model Garden > Model Collections > Partner Models, y luego seleccionar cualquiera de los Voyage AI modelos listados allí.
También puedes desplazarte hacia abajo hasta Task-specific solutions para encontrar modelos Voyage IA que puedes utilizar tal cual o personalizar según tus necesidades.
Implementar un modelo de IA de Voyage en la plataforma de agentes de Gemini Enterprise
Para hacer predicciones utilizando un modelo de Voyage IA por MongoDB, debes implementarlo en un punto final privado y dedicado para inferencias en linea. La implementación asocia recursos físicos con un modelo para predicciones en línea de baja latencia y alto rendimiento. Puedes implementar varios modelos en un único endpoint o el mismo modelo en varios endpoints.
Cuando implementes un modelo, considera las siguientes opciones:
Ubicación del endpoint
Contenedor de modelos
Recursos de computación requeridos para ejecutar el modelo
Una vez que implementes un modelo, no puedes cambiar estas configuraciones. Si necesitas modificar cualquier configuración de implementación, debes dejar de utilizar el modelo y volver a implementarlo con la nueva configuración.
Los modelos de Voyage AI requieren un punto de conexión público dedicado. Para obtener más información, consulte la sección «Crear un punto de conexión público» en la documentación de Gemini Enterprise Agent Platform.
Para implementar un modelo en Gemini Enterprise Agent Platform usando la consola:
Localiza el modelo.
Ve a la consola de Model Garden y busca "Voyage" en el Search Models campo para mostrar la lista de modelos Voyage AI de MongoDB.
Activa el modelo y acepta el acuerdo.
Haz clic en Enable. Se abre el Acuerdo de Usuario Final de MongoDB Marketplace. Revise y acepte el acuerdo para habilitar el modelo y obtener las licencias necesarias para uso comercial.
Revisa las opciones de implementación.
Después de aceptar el acuerdo, la página del modelo mostrará las siguientes opciones:
Deploy a modelAhorra: Guarda el modelo en el Registro de Modelos y lo implementa en un endpoint en Google Cloud. Sigue con los siguientes pasos para implementar usando la consola.
Create an Open Notebook for Voyage Embedding Models Family: te permite afinar y personalizar tu modelo en un entorno colaborativo, así como combinar modelos para optimizar costos y rendimiento. Consulta Vertex AI Notebook Muestras para Voyage IA.
View Code: Muestra muestras de código para implementar y usar el modelo. Para implementar programáticamente usando código, consulta Implementar usando código.
Completa el formulario de implementación.
Se abre un formulario que le permite revisar y editar las opciones de implementación. La plataforma de agentes de Gemini Enterprise proporciona configuraciones por defecto optimizadas para el modelo, pero puede personalizarlas según sea necesario. Por ejemplo, puede seleccionar el tipo de máquina, el tipo de GPU y el número de réplicas. El siguiente ejemplo muestra la configuración por defecto para el modelo voyage-4, pero estas pueden cambiar, así que revise la configuración cuidadosamente antes de implementar.
Campo | Descripción |
|---|---|
Resource ID | Selecciona en el menú desplegable (preseleccionado). |
Model Name | Selecciona en el menú desplegable (preseleccionado). |
Region | Selecciona la región deseada, como |
Endpoint name | Proporcione un nombre para su endpoint, como |
Serving spec | Selecciona el tipo de máquina, como |
Accelerator type | Selecciona el tipo de GPU, como |
Accelerator count | Especifique el número de GPUs, como |
Replica count | Especifique el número mínimo y máximo de réplicas, como |
Reservation type | Selecciona un tipo de reserva, como |
VM provisioning model | Selecciona un modelo de provisionamineto, como |
Endpoint access | Seleccione Public (Dedicated endpoint). |
Implementar usando código
Si seleccionaste View Code en la página de detalles del modelo, puedes implementar un modelo mediante programación usando el SDK de Vertex AI. Este enfoque proporciona control total sobre la configuración de implementación a través del código.
Para obtener más información sobre el SDK de IA Vertex de Google Cloud, consulta la documentación del SDK de IA Vertex para Python.
Nota
Los ejemplos de código en esta sección son para el modelo voyage-4 y están sujetos a cambios. Para obtener los ejemplos de código más actuales, consulta la pestaña View Code en la página del modelo en el Model Garden. Para otros modelos de Voyage IA, el código es similar, pero verifica la página de ese modelo en el Model Garden para detalles específicos del modelo.
Para implementar un modelo usando código:
Inicializa el modelo.
Primero, inicialice el modelo desde el Model Garden y vea las opciones de implementación:
from vertexai import model_garden MODEL_NAME = "mongodb/voyage-4@latest" model = model_garden.OpenModel(MODEL_NAME) deploy_options = model.list_deploy_options(concise=True) print(deploy_options)
Implementar en un endpoint.
Elige si deseas implementar un nuevo modelo o utilizar un endpoint existente:
# Choose whether to deploy a new model or use an existing endpoint: deployment_option = "deploy_new" # ["deploy_new", "use_existing"] # If using existing endpoint, provide the endpoint ID: ENDPOINT_ID = "" # {type:"string"} if deployment_option == "deploy_new": print("Deploying new model...") endpoint = model.deploy( machine_type="a3-highgpu-1g", accelerator_type="NVIDIA_H100_80GB", accelerator_count=1, accept_eula=True, use_dedicated_endpoint=True, ) print(f"Endpoint deployed: {endpoint.display_name}") print(f"Endpoint resource name: {endpoint.resource_name}") else: if not ENDPOINT_ID: raise ValueError("Please provide an ENDPOINT_ID when using existing endpoint") from google.cloud import aiplatform print(f"Connecting to existing endpoint: {ENDPOINT_ID}") endpoint = aiplatform.Endpoint( endpoint_name=f"projects/{PROJECT_ID}/locations/{LOCATION}/endpoints/{ENDPOINT_ID}" ) print(f"Using endpoint: {endpoint.display_name}") print(f"Endpoint resource name: {endpoint.resource_name}")
Importante
Establece use_dedicated_endpoint en True ya que los modelos de Voyage IA requieren un endpoint público dedicado.
Gemini Enterprise Agent Platform implementa el modelo en un punto de conexión gestionado al que puede acceder para realizar inferencias en línea o inferencias por lotes a través de la consola de Google Cloud o la API de Gemini Enterprise Agent Platform.
Para obtener más información, consulte la sección "Implementar un modelo en un punto final" en la documentación de Gemini Enterprise Agent Platform.
Haz predicciones.
Después de la implementación, puede hacer predicciones utilizando el endpoint de Gemini Enterprise Agent Platform.
Para todos los parámetros del endpoint y opciones de predicción, consulta la Descripción general de la API de integración y reordenamiento.
import json # Multiple texts to embed texts = [ "Machine learning enables computers to learn from data.", "Natural language processing helps computers understand human language.", "Computer vision allows machines to interpret visual information.", "Deep learning uses neural networks with multiple layers." ] # Prepare the batch request and make invoke call body = { "input": texts, "output_dimension": 1024, "input_type": "document" } response = endpoint.invoke( request_path="/embeddings", body=json.dumps(body).encode("utf-8"), headers={"Content-Type": "application/json"} ) # Extract embeddings result = response.json() embeddings = [item["embedding"] for item in result["data"]] print(f"Number of texts embedded: {len(embeddings)}") print(f"Embedding dimension: {len(embeddings[0])}") print(f"\nFirst embedding (first 5 values): {embeddings[0][:5]}") print(f"Second embedding (first 5 values): {embeddings[1][:5]}")
Despliega un modelo y borra el endpoint
Para remover un modelo implementado y su endpoint:
Desinstalar el modelo del punto final.
Opcionalmente, borra el propio endpoint.
Para obtener instrucciones detalladas, consulte la sección "Desinstalar un modelo y eliminar el punto final" en la documentación de Gemini Enterprise Agent Platform.
Importante
Solo puedes borrar el endpoint después de que todos los modelos hayan sido retirados de él. Desplegar modelos y borrar el endpoint detiene todos los servicios de inferencia y la facturación para ese endpoint.