Puede explorar e implementar modelos de Voyage AI by MongoDB desde Model Garden en Gemini Enterprise Agent Platform, formalmente GCP Vertex AI.
Model Garden gestiona las licencias de modelos de IA de Voyage AI by MongoDB y proporciona opciones de implementación utilizando hardware on-demand o tus reservas existentes de Compute Engine.
Los modelos Voyage AI de MongoDB son modelos de socios autogestionados, lo que significa que pagas tanto por el uso del modelo como por la infraestructura de Gemini Enterprise Agent Platform que consumes. Gemini Enterprise Agent Platform gestiona la implementación y proporciona funcionalidades de gestión de endpoints.
Modelos disponibles
Para ver qué modelos puedes implementar, busca "Voyage" en el Model Garden en Gemini Enterprise Agent Platform.
Para obtener más información acerca de los modelos de IA de Voyage, consulte Descripción general de los modelos.
Precios
El precio de los modelos de Voyage AI by MongoDB en Model Garden en Gemini Enterprise Agent Platform incluye:
Tarifa de uso del modelo: Un costo por utilizar el contenedor del modelo IA de Voyage, facturado a una tarifa por hora. La tarifa de uso depende del modelo específico y de la configuración de hardware que elijas para la implementación. Para obtener información detallada sobre precios, consulta la sección de precios en la página de listado del modelo en Google Cloud Marketplace.
Instancia subyacente de Google Cloud en tu región: El costo de la instancia de GPU subyacente de Google Cloud, como NVIDIA L4, A100, o H100, que es específica de una región, se factura mensualmente y se cobra por vCPU. Para aprender más, consulte Precios de Google Cloud Compute Engine.
Todos los cargos de facturación aparecen como el uso de Gemini Enterprise Agent Platform en su factura de Google Cloud Platform.
Para ver el precio de un modelo específico de Voyage IA:
Ve a Model Garden.
Quotas
Cuando implementas modelos de Voyage AI, consumes recursos de la plataforma de agentes empresariales de Gemini que están sujetos a cuotas. Puedes ver y gestionar tus cuotas en la sección Quotas de la página IAM de Google Cloud Console. Para obtener más información, consulta Ver las cuotas de tu proyecto. En la misma página, puedes hacer clic con el botón derecho en cualquier cuota actual, hacer clic en Edit quota y enviar una solicitud para aumentar tu cuota si es necesario.
Requisitos previos
Para empezar a usar los modelos Voyage AI de MongoDB a través de la plataforma de agentes empresariales Gemini, debes:
Configura un proyecto de Google Cloud y un entorno de desarrollo. Para obtener instrucciones, consulta Configura tu proyecto y entorno de desarrollo.
Habilite la API de Gemini Enterprise agente Platform. Para obtener instrucciones, consulte Configurar.
Configuración de hardware
Cada modelo de Model Garden enumera su configuración de hardware recomendada. Consulte Model Garden en Gemini Enterprise Agent Platform para conocer las especificaciones de hardware recomendadas de cada modelo de Voyage.
Por ejemplo, para el modelo voyage-4, utiliza las siguientes instancias recomendadas que Model Garden en la plataforma de agentes empresariales de Gemini sugiere para la implementación. Estas recomendaciones pueden cambiar y te recomendamos que consultes la página oficial de Model Garden en la plataforma de agentes empresariales de Gemini para un modelo de Voyage AI en particular para ver su hardware recomendado.
Las instancias A2 , tales como
a2-highgpu-1goa2-ultragpu-1g, con GPUs A100 son la opción por defecto.Se recomienda A3 instancias, como
a3-highgpu-1g, con GPUs H100 para necesidades de mayor rendimiento.
Regiones admitidas
Model Garden enumera las regiones compatibles para cada modelo de Voyage IA. Si necesitas soporte en otra región para cualquiera de los modelos, contacta soporte de MongoDB.
Mejores prácticas y limitaciones
Tipo de endpoint: Todos los modelos de Voyage IA requieren un tipo de endpoint público dedicado. Para obtener más información, consulta Elige un tipo de endpoint.
Comprenda input_type: query vs. Documento: El parámetro
input_typeoptimiza las incrustaciones para tareas de recuperación. Utiliza"query"para consultas de búsqueda y"document"para el contenido que se está buscando. Esta optimización mejora la precisión de la recuperación. Para aprender más sobre el parámetroinput_type, consulta la Visión general de la API de incrustación y renacionalización.Usar diferentes dimensiones de salida: los modelos Voyage 4 admiten múltiples dimensiones de salida: 256, 512, 1024 (por defecto) y 2048. Las dimensiones más pequeñas reducen los costos de almacenamiento y computación, mientras que las dimensiones más grandes pueden proporcionar una mejor precisión. Elige la dimensión que mejor equilibre tus requisitos de precisión con las limitaciones de recursos.
Ubique los Modelos Voyage IA
Para encontrar los modelos de Voyage AI by MongoDB en el Model Garden:
Go a Model Garden.
Ve a la consola de Model Garden.
Busca modelos de Voyage.
En el campo Search Models, ingresa "Voyage" para mostrar la lista de modelos Voyage IA de MongoDB.
Nota
El Google Cloud Marketplace tiene dos cuadros de búsqueda: uno para todo el Marketplace y otro dentro de Model Garden en Gemini Enterprise Agent Platform. Para localizar los modelos de Voyage AI by MongoDB, utilice el cuadro de búsqueda en Model Garden en Gemini Enterprise Agent Platform.
Alternativamente, puedes navegar a los modelos de Voyage IA a través de Model Garden > Model Collections > Partner Models, y luego seleccionar cualquiera de los Voyage AI modelos listados allí.
También puedes desplazarte hacia abajo hasta Task-specific solutions para encontrar modelos Voyage IA que puedes utilizar tal cual o personalizar según tus necesidades.
Implementar un modelo de IA de Voyage en la plataforma de agentes de Gemini Enterprise
Para hacer predicciones utilizando un modelo de Voyage IA por MongoDB, debes implementarlo en un punto final privado y dedicado para inferencias en linea. La implementación asocia recursos físicos con un modelo para predicciones en línea de baja latencia y alto rendimiento. Puedes implementar varios modelos en un único endpoint o el mismo modelo en varios endpoints.
Cuando implementes un modelo, considera las siguientes opciones:
Ubicación del endpoint
Contenedor de modelos
Recursos de computación requeridos para ejecutar el modelo
Una vez que implementes un modelo, no puedes cambiar estas configuraciones. Si necesitas modificar cualquier configuración de implementación, debes dejar de utilizar el modelo y volver a implementarlo con la nueva configuración.
Los modelos de Voyage AI requieren un endpoint público dedicado. Para obtener más información, consulte Crear un endpoint público en la documentación de la plataforma de agente empresarial de Gemini.
Para implementar un modelo en Gemini Enterprise Agent Platform usando la consola:
Localiza el modelo.
Ve a la consola de Model Garden y busca "Voyage" en el campo Search Models para mostrar la lista de modelos de Voyage IA de MongoDB.
Activa el modelo y acepta el acuerdo.
Haz clic en Enable. Se abre el Acuerdo de Usuario Final de MongoDB Marketplace. Revise y acepte el acuerdo para habilitar el modelo y obtener las licencias necesarias para uso comercial.
Revisa las opciones de implementación.
Después de aceptar el acuerdo, la página del modelo mostrará las siguientes opciones:
Deploy a modelAhorra: Guarda el modelo en el Registro de Modelos y lo implementa en un endpoint en Google Cloud. Sigue con los siguientes pasos para implementar usando la consola.
Create an Open Notebook for Voyage Embedding Models Family: te permite afinar y personalizar tu modelo en un entorno colaborativo, así como combinar modelos para optimizar costos y rendimiento. Consulta Vertex AI Notebook Muestras para Voyage IA.
View Code: Muestra muestras de código para implementar y usar el modelo. Para implementar programáticamente usando código, consulta Implementar usando código.
Haz clic Deploy modelen.
Haga clic en el botón Deploy model para iniciar el proceso de implementación.
Completa el formulario de implementación.
Se abre un formulario que le permite revisar y editar las opciones de implementación. La plataforma de agentes de Gemini Enterprise proporciona configuraciones por defecto optimizadas para el modelo, pero puede personalizarlas según sea necesario. Por ejemplo, puede seleccionar el tipo de máquina, el tipo de GPU y el número de réplicas. El siguiente ejemplo muestra la configuración por defecto para el modelo voyage-4, pero estas pueden cambiar, así que revise la configuración cuidadosamente antes de implementar.
Campo | Descripción |
|---|---|
Resource ID | Selecciona en el menú desplegable (preseleccionado). |
Model Name | Selecciona en el menú desplegable (preseleccionado). |
Region | Selecciona la región deseada, como |
Endpoint name | Proporcione un nombre para su endpoint, como |
Serving spec | Selecciona el tipo de máquina, como |
Accelerator type | Selecciona el tipo de GPU, como |
Accelerator count | Especifique el número de GPUs, como |
Replica count | Especifique el número mínimo y máximo de réplicas, como |
Reservation type | Selecciona un tipo de reserva, como |
VM provisioning model | Selecciona un modelo de provisionamineto, como |
Endpoint access | Seleccione Public (Dedicated endpoint). |
Implementar usando código
Si seleccionaste View Code en la página de detalles del modelo, puedes implementar un modelo mediante programación usando el SDK de Vertex AI. Este enfoque proporciona control total sobre la configuración de implementación a través del código.
Para obtener más información sobre el SDK de IA Vertex de Google Cloud, consulta la documentación del SDK de IA Vertex para Python.
Nota
Los ejemplos de código en esta sección son para el modelo voyage-4 y están sujetos a cambios. Para obtener los ejemplos de código más actuales, consulta la pestaña View Code en la página del modelo en el Model Garden. Para otros modelos de Voyage IA, el código es similar, pero verifica la página de ese modelo en el Model Garden para detalles específicos del modelo.
Para implementar un modelo usando código:
Inicializa el modelo.
Primero, inicialice el modelo desde el Model Garden y vea las opciones de implementación:
from vertexai import model_garden MODEL_NAME = "mongodb/voyage-4@latest" model = model_garden.OpenModel(MODEL_NAME) deploy_options = model.list_deploy_options(concise=True) print(deploy_options)
Implementar en un endpoint.
Elige si deseas implementar un nuevo modelo o utilizar un endpoint existente:
# Choose whether to deploy a new model or use an existing endpoint: deployment_option = "deploy_new" # ["deploy_new", "use_existing"] # If using existing endpoint, provide the endpoint ID: ENDPOINT_ID = "" # {type:"string"} if deployment_option == "deploy_new": print("Deploying new model...") endpoint = model.deploy( machine_type="a3-highgpu-1g", accelerator_type="NVIDIA_H100_80GB", accelerator_count=1, accept_eula=True, use_dedicated_endpoint=True, ) print(f"Endpoint deployed: {endpoint.display_name}") print(f"Endpoint resource name: {endpoint.resource_name}") else: if not ENDPOINT_ID: raise ValueError("Please provide an ENDPOINT_ID when using existing endpoint") from google.cloud import aiplatform print(f"Connecting to existing endpoint: {ENDPOINT_ID}") endpoint = aiplatform.Endpoint( endpoint_name=f"projects/{PROJECT_ID}/locations/{LOCATION}/endpoints/{ENDPOINT_ID}" ) print(f"Using endpoint: {endpoint.display_name}") print(f"Endpoint resource name: {endpoint.resource_name}")
Importante
Establece use_dedicated_endpoint en True ya que los modelos de Voyage IA requieren un endpoint público dedicado.
Gemini Enterprise Agent Platform implementa el modelo en un punto de conexión gestionado al que puede acceder para realizar inferencias en línea o inferencias por lotes a través de la consola de Google Cloud o la API de Gemini Enterprise Agent Platform.
Para obtener más información, consulte Implementar un modelo en un endpoint en la documentación de Gemini Enterprise Agent Platform.
Haz predicciones.
Después de la implementación, puede hacer predicciones utilizando el endpoint de Gemini Enterprise Agent Platform.
Para todos los parámetros del endpoint y opciones de predicción, consulta la Descripción general de la API de integración y reordenamiento.
import json # Multiple texts to embed texts = [ "Machine learning enables computers to learn from data.", "Natural language processing helps computers understand human language.", "Computer vision allows machines to interpret visual information.", "Deep learning uses neural networks with multiple layers." ] # Prepare the batch request and make invoke call body = { "input": texts, "output_dimension": 1024, "input_type": "document" } response = endpoint.invoke( request_path="/embeddings", body=json.dumps(body).encode("utf-8"), headers={"Content-Type": "application/json"} ) # Extract embeddings result = response.json() embeddings = [item["embedding"] for item in result["data"]] print(f"Number of texts embedded: {len(embeddings)}") print(f"Embedding dimension: {len(embeddings[0])}") print(f"\nFirst embedding (first 5 values): {embeddings[0][:5]}") print(f"Second embedding (first 5 values): {embeddings[1][:5]}")
Despliega un modelo y borra el endpoint
Para remover un modelo implementado y su endpoint:
Desinstalar el modelo del punto final.
Opcionalmente, borra el propio endpoint.
Para obtener instrucciones detalladas, consulta Anular la implementación de un modelo y borrar el extremo en la documentación de la plataforma de agentes empresariales de Gemini.
Importante
Solo puedes borrar el endpoint después de que todos los modelos hayan sido retirados de él. Desplegar modelos y borrar el endpoint detiene todos los servicios de inferencia y la facturación para ese endpoint.