Los límites de velocidad son restricciones sobre la frecuencia y el número de tokens que puedes solicitar a Voyage IA dentro de un período de tiempo específico. Para obtener más información sobre los límites de velocidad, consulta mejores prácticas.
Atlas aplica límites de velocidad basados en el uso de la clave API del modelo (solicitudes por minuto (RPM) y tokens por minuto (TPM)). Si se supera el número de solicitudes o tokens en el último minuto, la API rechaza cualquier solicitud adicional posterior y devuelve un código de estado HTTP 429 (Límite de velocidad excedido).
Gestionar límites de tasa
Las siguientes secciones describen cómo gestionar los límites de frecuencia en la interfaz de usuario de Atlas.
Permisos requeridos
Para establecer y restablecer límites de tasa a nivel de proyecto, debes tener Project Owner acceso a Atlas o superior.
Para ver los límites de tarifas:
A nivel organizativo y de proyecto, debes tener
Organization Read Onlyo un nivel de acceso superior a Atlas.Solo a nivel de proyecto, debes tener acceso
Project Read Onlyo superior a Atlas.
Establecer límites de velocidad
Puedes establecer diferentes límites para cada proyecto a nivel de proyecto. Los límites de velocidad a nivel de proyecto no pueden exceder los límites de velocidad para la organización. Los límites de velocidad establecidos a nivel de proyecto se aplican a todas las claves de API de modelos para el proyecto.
Inicia sesión en Atlas.
Ve a la página AI Model APIs en la Interfaz de Usuario de Atlas.
Si aún no se muestra, selecciona la organización deseada en el menú Organizations de la barra de navegación.
Si aún no aparece, selecciona el proyecto deseado en el menú Projects de la barra de navegación.
A nivel de proyecto, haz clic en AI Model APIs en el encabezado Services de la barra de navegación.
Establece los límites de velocidad para el proyecto.
Desde la barra de navegación, selecciona Rate Limits.
En la columna Actions correspondiente al modelo de embeddings para el que desees modificar los límites de velocidad, haz clic en .
Modifica los valores de TPM y RPM.
Los límites de frecuencia a nivel de proyecto para cada modelo pueden ser cualquier valor menor o igual al límite de frecuencia de la organización.
Ejemplo
En el nivel de uso 1, los límites de tasas para el modelo de embeddings
voyage-4de un proyecto pueden establecerse en2000RPM y8,000,000TPM, o más bajos.Haz clic en para aplicar el límite de velocidad.
Ver límites de velocidad
Puedes ver los límites de tasas a nivel de organización y de proyecto.
Inicia sesión en Atlas.
La página muestra la siguiente información:
Nombre | Descripción |
|---|---|
Model | Lista de modelos de incrustación de Voyage IA. |
Tokens Per Minute (TPM) | Número de tokens que puedes solicitar en un minuto desde los puntos finales de las API de Embedding y Reranking. |
Requests Per Min (RPM) | Número de solicitudes API que puedes enviar en un minuto a los endpoints API de Embedding y Reranking. |
Inicia sesión en Atlas.
Ve a la página AI Model APIs en la Interfaz de Usuario de Atlas.
Si aún no se muestra, selecciona la organización deseada en el menú Organizations de la barra de navegación.
Si aún no aparece, selecciona el proyecto deseado en el menú Projects de la barra de navegación.
A nivel de proyecto, haz clic en AI Model APIs en el encabezado Services de la barra de navegación.
Seleccione Rate Limits desde el menú a la izquierda.
La página muestra la siguiente información sobre los límites de velocidad:
Nombre de columna | Descripción de la columna |
|---|---|
Model | Lista de modelos de incrustación de Voyage IA. |
Tokens Per Minute (TPM) | El número de tokens que puedes solicitar por minuto desde los endpoints de la API de Embedding y Reranking de Voyage IA. |
Requests Per Min (RPM) | Número de solicitudes que puedes enviar en un minuto a los puntos finales de la API Embedding y Reranking de Voyage IA. |
Actions | Acciones que puedes tomar. Puedes:
|
Si establece límites personalizados, la página también muestra el botón Reset all limits para revertir todos los límites de velocidad personalizados de la página al valor por defecto de la organización.
Restablecer todos los límites de velocidad
Puedes restablecer todos los límites personalizados que hayas establecido para un proyecto en cualquier momento. Cuando restablezcas los límites, los límites de frecuencia del Proyecto volverán a los límites de frecuencia por defecto para la organización.
Inicia sesión en Atlas.
Ve a la página AI Model APIs en la Interfaz de Usuario de Atlas.
Si aún no se muestra, selecciona la organización deseada en el menú Organizations de la barra de navegación.
Si aún no aparece, selecciona el proyecto deseado en el menú Projects de la barra de navegación.
A nivel de proyecto, haz clic en AI Model APIs en el encabezado Services de la barra de navegación.
Niveles de uso
Los límites de uso siguen un sistema escalonado, donde los niveles superiores ofrecen límites mayores. La calificación para un nivel se basa en el uso facturado (excluyendo los tokens gratuitos). Atlas ofrece 200 millones de tokens gratuitos para cada modelo. Los modelos multimodales también incluyen 150,000,000,000 píxeles gratuitos. Una vez que califica para un nivel, nunca se degrada. A medida que aumenta su uso y gasto, Atlas lo promueve automáticamente al siguiente nivel de uso, aumentando los límites de uso en todos los modelos.
Para obtener más información, consulta Límites de cuota y niveles de uso.
Límites de tasa por defecto
Esta sección describe los límites de tasa por defecto para cada nivel de uso que se aplican a nivel organizacional. También describe los límites de velocidad que se pueden configurar para cada proyecto.
Límites de tasa de la organización
Las siguientes tablas muestran los límites de velocidad por defecto (TPM y RPM) según el nivel de uso para cada modelo de embedding de Voyage IA.
Modelo | Tokens Per Min (TPM) | solicitudes por minuto (RPM) |
|---|---|---|
| 16,000,000 | 2,000 |
| 8,000,000 | 2,000 |
| 3,000,000 | 2,000 |
| 3,000,000 | 2,000 |
| 2,000,000 | 2,000 |
| 4,000,000 | 2,000 |
| 2,000,000 | 2,000 |
Los límites de tasa para el nivel de uso 2 son el doble que los del nivel de uso 1.
Modelo | Tokens Per Min (TPM) | solicitudes por minuto (RPM) |
|---|---|---|
| 32,000,000 | 4,000 |
| 16,000,000 | 4,000 |
| 6,000,000 | 4,000 |
| 6,000,000 | 4,000 |
| 4,000,000 | 4,000 |
| 8,000,000 | 4,000 |
| 4,000,000 | 4,000 |
Los límites de tasa para el nivel de uso 3 son tres veces los del nivel de uso 1.
Modelo | Tokens Per Min (TPM) | solicitudes por minuto (RPM) |
|---|---|---|
| 48,000,000 | 6,000 |
| 24,000,000 | 6,000 |
| 9,000,000 | 6,000 |
| 9,000,000 | 6,000 |
| 6,000,000 | 6,000 |
| 12,000,000 | 6,000 |
| 6,000,000 | 6,000 |
Límites de velocidad del proyecto
Por defecto, los proyectos heredan los límites de tasa en función de los límites de tasa para la organización. Sin embargo, se pueden establecer límites diferentes para cada proyecto a nivel de proyecto. Los límites de velocidad a nivel de proyecto no pueden exceder los límites de velocidad de la organización. Los límites de velocidad establecidos a nivel de proyecto se aplican a todas las claves API de modelos del proyecto. Sin embargo, si primero se alcanza el límite de velocidad de la organización, los proyectos podrían verse limitados a una velocidad inferior. Esto puede ocurrir cuando la suma de todos los límites de velocidad del proyecto excede el límite de la organización.
Ejemplo
Considera un límite de tasa organizacional O con tres proyectos con límites de tasa P1, P2 y P3. La siguiente tabla ilustra tres escenarios en los que la suma de los límites de tasa del proyecto es menor, igual o mayor que el límite de tasa de la organización. Para cada escenario, la tabla indica si se puede alcanzar el límite de la organización y si el uso de un proyecto puede tener un impacto en otro.
Scenario 1 P1 + P2 + P3 < O | Scenario 2 P1 + P2 + P3 = O | Scenario 3 P1 + P2 + P3 > O | |
|---|---|---|---|
Descripción del escenario | La suma de todos los límites de velocidad del proyecto es inferior al límite de la organización. | La suma de todos los límites de tasa del proyecto es igual a el límite de la organización. | La suma de todos los límites de velocidad del proyecto es superior a al límite de la organización. |
¿Se puede alcanzar el límite de la organización? | No, incluso si todos los proyectos alcanzan sus límites de velocidad, el límite de velocidad de la organización no se superará. | Sí, si todos los proyectos alcanzan sus límites de tasa, el límite de la organización también se alcanzará. | 是的,由于所有 **proyectos** 的速率限制总和超过了 **organización** 限制,在各个 **proyectos** 达到各自限制前,可能先达到 **organización** 限制。 |
¿Puede el uso de un Proyecto tener un impacto en otro? | No. | No. | Sí. Si los proyectos consumen en conjunto suficiente uso para alcanzar el límite de la organización antes de que alguno o todos los proyectos alcancen sus límites individuales, los proyectos pueden estar sujetos a un límite de tasa inferior al de sus límites individuales. |
Límites de tarifas geográficas
Nota
Vista previa pública
La geografía de Europa y su endpoint, eu.ai.mongodb.com, están disponibles como funcionalidad de vista previa pública. La funcionalidad y la documentación correspondiente pueden cambiar en cualquier momento durante el período de vista previa.
Los puntos finales con ámbito definido tienen sus propios límites de velocidad, distintos de los límites que se aplican a los puntos finales sin ámbito definido. Atlas establece estos límites por ámbito, es decir, por combinación de proveedor de nube y ubicación geográfica. Los límites de velocidad para los puntos finales con ámbito definido son los mismos que para los puntos finales sin ámbito definido; sin embargo, debe solicitar un aumento para los límites de nivel 2 y nivel 3 para los puntos finales con ámbito definido. Por el contrario, Atlas aplica automáticamente las actualizaciones para los puntos finales sin ámbito definido.
Los endpoints con ámbito también requieren un nivel de uso de pago. Para obtener más información, consulte Niveles de uso.
Para obtener más información sobre las geografías y sus endpoints, consulta Geografías para la inferencia de Voyage AI.
Mejores prácticas
Los límites de velocidad garantizan un uso equilibrado y eficiente de los recursos de la API, evitando un tráfico excesivo que podría afectar el rendimiento general y la accesibilidad del servicio. En concreto, los límites de velocidad cumplen las siguientes funciones vitales:
La limitación de solicitudes promueve un acceso equitativo a la API para todos los usuarios. Si una persona u organización genera un volumen excesivo de solicitudes, podría afectar el rendimiento de la API para otros. Mediante la limitación de solicitudes, garantizamos que un mayor número de usuarios pueda utilizar la API sin experimentar problemas de rendimiento.
Los límites de tasa permiten a Voyage AI gestionar eficazmente la carga de trabajo en su infraestructura. Picos súbitos y sustanciales en las solicitudes de API podrían sobrecargar los recursos del servidor y provocar una degradación del rendimiento. Al establecer límites de tasa, Voyage IA puede mantener de manera efectiva una experiencia coherente y fiable para todos los los usuarios.
Actúan como salvaguarda contra posibles abusos o usos indebidos de la API. Por ejemplo, los actores malintencionados podrían intentar inundar la API con solicitudes excesivas para sobrecargarla o interrumpir sus servicios. Al establecer límites de velocidad, Voyage IA puede frustrar tales actividades nefastas.
Para evitar y gestionar errores de límite de velocidad, recomendamos las siguientes mejores prácticas.
Utilice lotes grandes
Si tienes muchos documentos para incorporar, puedes aumentar la cantidad de documentos que incorporas por solicitud y mejorar tu rendimiento enviando paquetes más grandes. Un "lote" es la colección de documentos que estás incorporando en una solicitud, y el "tamaño de lote" es el número de documentos en el lote, es decir, la longitud de la lista de documentos.
Ejemplo
Supongamos que desea vectorizar 512 documentos. Si utiliza un tamaño de lote de 1, esto requeriría 512 solicitudes y podría alcanzar su límite de RPM. Sin embargo, si utiliza un tamaño de lote de 128, esto requeriría solo 4 solicitudes y no alcanzaría su límite de RPM. Puede controlar el tamaño del lote modificando la cantidad de documentos que proporciona en la solicitud; el uso de lotes más grandes reducirá su RPM general para una cantidad determinada de documentos.
Debes considerar el tamaño máximo de lote API y los tokens al seleccionar tu tamaño de lote. No se puede superar el tamaño máximo de agrupar de la API. Si tienes documentos más largos, el límite de tokens por solicitud podría obligarte a trabajar con un tamaño de lote más pequeño.
Establecer un periodo de espera
Realiza solicitudes con menor frecuencia. Puedes hacerlo escalonando tus solicitudes, y el enfoque más sencillo es insertar un período de espera entre cada solicitud.
Realice retroceso exponencial
Retrocede una vez que alcances tu límite de tasa (es decir, cuando recibas un error 429). Podrías esperar un tiempo exponencialmente mayor tras recibir un error de límite de tasa antes de intentar nuevamente. Espera a que la solicitud sea exitosa o hasta que se alcance el número máximo de reintentos.
Ejemplo
Si tu tiempo de espera inicial era de un segundo y recibiste tres errores de límite de velocidad consecutivos antes de tener éxito, deberías esperar uno, dos y cuatro segundos después de cada error de límite de velocidad, respectivamente, antes de volver a enviar la solicitud.