Límites de OpenAI API: RPM, TPM, error 429 y usage tiers
Los límites de OpenAI API controlan cuántas solicitudes, tokens y otras unidades puede procesar una aplicación durante un período determinado. Estos límites pueden variar según el modelo, usage tier, organización y proyecto, y son una parte fundamental al escalar aplicaciones con GPT.
¿Cómo funcionan los límites de OpenAI API?
OpenAI aplica límites sobre solicitudes, tokens y otros tipos de uso. Los más comunes son requests per minute (RPM) y tokens per minute (TPM). Los valores exactos dependen del modelo y del nivel de uso de la organización. Algunas restricciones pueden aplicarse también a nivel de proyecto.
Principales métricas de los rate limits
Una aplicación puede superar un límite aunque todavía se encuentre por debajo de otros.
Requests per minute
Número máximo de solicitudes que puedes enviar durante un minuto.
Tokens per minute
Cantidad máxima de tokens procesados dentro de un minuto.
Batch queue
Determinados modelos tienen un límite de tokens o trabajo en cola para Batch.
Organización
Algunos límites se aplican al conjunto de la organización.
Proyecto
También pueden existir límites configurados específicamente para un proyecto.
Usage tier
El nivel de uso influye en la capacidad permitida para muchos modelos.
Puedes superar TPM sin superar RPM
Cada tipo de límite se evalúa de forma independiente.
Pocas solicitudes con prompts enormes
Imagina que realizas únicamente 20 solicitudes durante un minuto, pero cada una contiene decenas de miles de tokens. Puedes permanecer bajo tu límite RPM y aun así superar TPM.
Muchas solicitudes pequeñas pueden superar RPM aunque el consumo total de tokens sea reducido.
Un 429 no significa siempre lo mismo
OpenAI utiliza respuestas 429 para diferentes situaciones. Antes de reintentar, debes identificar la causa exacta indicada en el error.
Rate limit
Exceso temporal de solicitudes o tokens.
Saldo agotado
La organización puede haberse quedado sin créditos prepagados.
Límite de gasto
Puede haberse alcanzado un tope de gasto de organización o proyecto.
Límites de organización y proyecto
Los rate limits no deben entenderse como cuotas individuales para cada usuario.
Nivel de organización
La organización puede tener un usage tier, límites aprobados y controles de gasto propios.
Nivel de proyecto
Los proyectos también pueden tener límites y controles específicos sobre su tráfico y gasto.
Si varias claves utilizan el mismo proyecto u organización, sus solicitudes pueden contribuir a los mismos límites aplicables.
Cómo funcionan los niveles de uso
OpenAI puede aumentar automáticamente el usage tier de una organización a medida que crece su gasto y antigüedad.
Más uso puede habilitar límites superiores
OpenAI indica que, conforme aumenta el gasto de API, una organización puede avanzar automáticamente a niveles superiores. Esto normalmente aumenta los rate limits de muchos modelos.
El límite mensual de uso aprobado y los rate limits son controles distintos. Aumentar uno no implica necesariamente que el otro cambie.
Los límites varían según el modelo
No existe un único RPM o TPM para toda OpenAI API.
| Factor | Puede cambiar |
|---|---|
| Modelo | Sí |
| Familia de modelos | Sí, algunas comparten límites |
| Usage tier | Sí |
| Organización | Sí |
| Proyecto | Puede aplicar |
| Endpoint | Puede utilizar métricas diferentes |
El valor que tiene otra organización no necesariamente coincide con el límite disponible en tu proyecto.
GPT-6 y GPT-5.6 también tienen límites por tier
Los modelos actuales muestran límites específicos según el nivel de uso.
GPT-6 Astra: modelo de máxima capacidad.
GPT-5.6 Sol: flagship para trabajo complejo.
GPT-5.6 Terra: equilibrio de capacidad y costo.
GPT-5.6 Luna: alto volumen y bajo costo.
Los valores concretos de RPM, TPM y Batch deben revisarse en la cuenta o documentación del modelo correspondiente.
Puedes recibir un 429 aunque estés bajo el promedio por minuto
Los límites pueden aplicarse en ventanas más pequeñas que el intervalo que aparece en pantalla.
60 solicitudes por minuto no significa 60 de golpe
Un límite expresado por minuto puede aplicarse también en períodos mucho más cortos. Una ráfaga de solicitudes puede generar errores aunque el promedio final parezca estar bajo el máximo.
Evita enviar todas las llamadas simultáneamente. Utiliza colas, control de concurrencia y distribución temporal.
Prompts largos también pueden causar rate limits
Una aplicación puede alcanzar TPM incluso con pocas solicitudes.
Elimina instrucciones que se repiten innecesariamente.
Evita reenviar contexto que el modelo ya no necesita.
Reduce ejemplos redundantes dentro del prompt.
Limita la salida al tamaño realmente necesario.
No configures salidas enormes si no las necesitas
Los parámetros de salida también influyen en la estimación de consumo.
| API | Parámetro |
|---|---|
| Responses API | max_output_tokens |
| Chat Completions | max_completion_tokens |
En modelos de razonamiento, estos límites deben contemplar tanto los tokens internos de razonamiento como la salida visible.
Error 429 en OpenAI API
El código 429 tiene varias causas posibles y cada una requiere una solución distinta.
| Error / código | Qué significa | Qué hacer |
|---|---|---|
| Rate limit reached | Superaste solicitudes o tokens permitidos | Reduce ritmo y aplica reintentos |
credit_balance_exhausted |
No quedan créditos prepagados | Agregar saldo |
organization_usage_limit_exceeded |
Se alcanzó el límite de uso aprobado | Solicitar aumento |
organization_spend_limit_exceeded |
La organización alcanzó su límite de gasto | Aumentar, eliminar o esperar reset |
project_spend_limit_exceeded |
El proyecto alcanzó su límite de gasto | Modificar el límite del proyecto |
Reintentar una solicitud no recuperará el acceso si el problema es saldo, límite de gasto o límite de uso. Primero debes resolver esa condición.
Exponential backoff para errores temporales
Cuando el 429 corresponde realmente a un rate limit temporal, no conviene repetir inmediatamente la misma solicitud.
Espera un período antes del primer reintento.
Incrementa progresivamente el tiempo de espera tras cada fallo.
Añade variación aleatoria para evitar que muchos clientes reintenten al mismo tiempo.
Establece un máximo de reintentos.
Registra el error si después de varios intentos continúa fallando.
Reintentar agresivamente puede empeorar la situación en lugar de solucionarla.
Límites de gasto y alertas
OpenAI distingue entre alertas y límites máximos de gasto.
| Control | Comportamiento |
|---|---|
| Alerta de gasto | Notifica, pero no necesariamente detiene el tráfico |
| Límite máximo de gasto | Puede detener solicitudes cuando se alcanza |
| Límite de organización | Abarca el gasto de sus proyectos |
| Límite de proyecto | Afecta el tráfico facturado a ese proyecto |
Los cambios y mediciones no siempre son instantáneos, por lo que puede existir una pequeña diferencia antes de que el límite se aplique completamente.
Batch tiene capacidad en cola propia
Los modelos pueden publicar un Batch queue limit separado de RPM y TPM.
Capacidad asincrónica
Cuando utilizas Batch, el modelo puede imponer un máximo de trabajo o tokens pendientes según tu usage tier.
Batch puede ser útil para procesamiento masivo cuando no necesitas una respuesta interactiva inmediata.
Cómo reducir el riesgo de alcanzar los límites
Una arquitectura eficiente puede soportar mucho más tráfico utilizando la misma capacidad.
Usa colas: distribuye solicitudes a lo largo del tiempo.
Controla concurrencia: evita picos innecesarios.
Reduce contexto: elimina información que el modelo no necesita.
Limita salida: evita reservar miles de tokens para respuestas cortas.
Model routing: utiliza Luna para tareas simples y Sol para casos complejos.
Batch: mueve tareas no urgentes fuera del flujo interactivo.
El modelo elegido también afecta la capacidad disponible
Una estrategia de routing permite reservar modelos más costosos y limitados para tareas realmente difíciles.
| Modelo | Uso recomendado |
|---|---|
| GPT-5.6 Luna | Clasificación, extracción y alto volumen |
| GPT-5.6 Terra | Análisis general y workloads intermedios |
| GPT-5.6 Sol | Trabajo profesional complejo |
| GPT-6 Astra | Trabajos end-to-end de máxima dificultad |
Enviar todas las solicitudes al modelo más potente puede aumentar costos y consumir capacidad innecesariamente.
Comparar modelos ChatGPT →Dónde ver tus límites actuales
Los valores reales disponibles para tu cuenta deben revisarse directamente en la plataforma.
Página Limits de la organización
Allí puedes consultar tu usage tier y los límites aplicables actualmente a tu organización.
Abrir página Limits →Si utilizas varios proyectos, revisa que la solicitud esté usando la organización y el proyecto correctos.
Cómo aumentar los límites de OpenAI API
El aumento depende del usage tier, historial de gasto y opciones disponibles para la organización.
Revisa primero el límite exacto que estás alcanzando.
Comprueba tu usage tier actual.
Verifica si existen opciones de aumento en la página Limits.
Si el problema es un spend limit, modifica ese control en lugar del rate limit.
Si el problema persiste, contacta soporte con los datos del error.
Qué guardar si necesitas contactar soporte
Un reporte completo facilita identificar el límite que está causando el problema.
Mensaje de error exacto.
Código o
error.code.
Request ID cuando esté disponible.
Fecha y hora junto con zona horaria.
Organización, proyecto y modelo utilizados.
Pasos que ya intentaste para solucionar el problema.
No incluyas claves API ni otros secretos de autenticación en una solicitud de soporte.
Documentación oficial sobre rate limits
OpenAI actualiza sus límites y controles de capacidad, por lo que la plataforma debe considerarse la referencia final.
Rate limits y errores 429
La guía oficial explica cómo identificar límites de solicitudes, créditos, gasto y usage tiers.
Consultar documentación oficial →Guías relacionadas con OpenAI API
Continúa con precios, modelos y uso de la plataforma.
FAQ sobre los límites de OpenAI API
Respuestas rápidas sobre RPM, TPM, errores 429, gasto y usage tiers.
RPM significa requests per minute y limita la cantidad de solicitudes que pueden realizarse durante un minuto.
TPM significa tokens per minute y controla la cantidad de tokens procesados durante un período determinado.
Puede significar un rate limit temporal, saldo prepagado agotado o un límite de uso o gasto.
No necesariamente. Los límites pueden aplicarse a nivel de organización o proyecto, por lo que varias claves pueden compartir capacidad.
Son niveles de uso que influyen en la capacidad disponible para muchos modelos.
Revisa la página Limits de tu organización. OpenAI también puede aumentar automáticamente el usage tier a medida que crece tu gasto en API.
Los límites pueden aplicarse en intervalos más pequeños que un minuto. Una ráfaga breve puede generar un error aunque el promedio parezca estar bajo el límite.
No. Si el error corresponde a un rate limit temporal, utiliza exponential backoff. Si corresponde a saldo, gasto o límite de uso, debes resolver primero esa condición.
No. Los límites de gasto, uso aprobado y rate limits son controles diferentes.
Continúa con los precios de OpenAI API
Ya conoces los límites. El siguiente paso es entender cuánto cuestan los modelos, tokens, cache y herramientas.
Ver precios de OpenAI API →