OpenAI API · Rate limits · Cuotas

Límites de OpenAI API: RPM, TPM, error 429 y usage tiers

Los límites de OpenAI API controlan cuántas solicitudes, tokens y otras unidades puede procesar una aplicación durante un período determinado. Estos límites pueden variar según el modelo, usage tier, organización y proyecto, y son una parte fundamental al escalar aplicaciones con GPT.

RPM TPM Usage tiers Guía Ciborg
Respuesta rápida

¿Cómo funcionan los límites de OpenAI API?

OpenAI aplica límites sobre solicitudes, tokens y otros tipos de uso. Los más comunes son requests per minute (RPM) y tokens per minute (TPM). Los valores exactos dependen del modelo y del nivel de uso de la organización. Algunas restricciones pueden aplicarse también a nivel de proyecto.

Conceptos fundamentales

Principales métricas de los rate limits

Una aplicación puede superar un límite aunque todavía se encuentre por debajo de otros.

RPM

Requests per minute

Número máximo de solicitudes que puedes enviar durante un minuto.

TPM

Tokens per minute

Cantidad máxima de tokens procesados dentro de un minuto.

BQ

Batch queue

Determinados modelos tienen un límite de tokens o trabajo en cola para Batch.

ORG

Organización

Algunos límites se aplican al conjunto de la organización.

PROJ

Proyecto

También pueden existir límites configurados específicamente para un proyecto.

TIER

Usage tier

El nivel de uso influye en la capacidad permitida para muchos modelos.

Publicidad
Ejemplo práctico

Puedes superar TPM sin superar RPM

Cada tipo de límite se evalúa de forma independiente.

Ejemplo

Pocas solicitudes con prompts enormes

Imagina que realizas únicamente 20 solicitudes durante un minuto, pero cada una contiene decenas de miles de tokens. Puedes permanecer bajo tu límite RPM y aun así superar TPM.

También puede ocurrir al revés

Muchas solicitudes pequeñas pueden superar RPM aunque el consumo total de tokens sea reducido.

Publicidad
Importante

Un 429 no significa siempre lo mismo

OpenAI utiliza respuestas 429 para diferentes situaciones. Antes de reintentar, debes identificar la causa exacta indicada en el error.

RATE

Rate limit

Exceso temporal de solicitudes o tokens.

CREDIT

Saldo agotado

La organización puede haberse quedado sin créditos prepagados.

SPEND

Límite de gasto

Puede haberse alcanzado un tope de gasto de organización o proyecto.

Alcance

Límites de organización y proyecto

Los rate limits no deben entenderse como cuotas individuales para cada usuario.

Organization

Nivel de organización

La organización puede tener un usage tier, límites aprobados y controles de gasto propios.

Project

Nivel de proyecto

Los proyectos también pueden tener límites y controles específicos sobre su tráfico y gasto.

Varias API keys no multiplican necesariamente tu capacidad

Si varias claves utilizan el mismo proyecto u organización, sus solicitudes pueden contribuir a los mismos límites aplicables.

Publicidad
Usage tiers

Cómo funcionan los niveles de uso

OpenAI puede aumentar automáticamente el usage tier de una organización a medida que crece su gasto y antigüedad.

Escalamiento automático

Más uso puede habilitar límites superiores

OpenAI indica que, conforme aumenta el gasto de API, una organización puede avanzar automáticamente a niveles superiores. Esto normalmente aumenta los rate limits de muchos modelos.

Usage tier no es lo mismo que presupuesto mensual

El límite mensual de uso aprobado y los rate limits son controles distintos. Aumentar uno no implica necesariamente que el otro cambie.

Modelos

Los límites varían según el modelo

No existe un único RPM o TPM para toda OpenAI API.

Factor Puede cambiar
Modelo
Familia de modelos Sí, algunas comparten límites
Usage tier
Organización
Proyecto Puede aplicar
Endpoint Puede utilizar métricas diferentes
No copies valores de otra cuenta

El valor que tiene otra organización no necesariamente coincide con el límite disponible en tu proyecto.

Familia actual

GPT-6 y GPT-5.6 también tienen límites por tier

Los modelos actuales muestran límites específicos según el nivel de uso.

01

GPT-6 Astra: modelo de máxima capacidad.

02

GPT-5.6 Sol: flagship para trabajo complejo.

03

GPT-5.6 Terra: equilibrio de capacidad y costo.

04

GPT-5.6 Luna: alto volumen y bajo costo.

Consulta siempre la página Limits

Los valores concretos de RPM, TPM y Batch deben revisarse en la cuenta o documentación del modelo correspondiente.

Publicidad
Ráfagas

Puedes recibir un 429 aunque estés bajo el promedio por minuto

Los límites pueden aplicarse en ventanas más pequeñas que el intervalo que aparece en pantalla.

Quantized limits

60 solicitudes por minuto no significa 60 de golpe

Un límite expresado por minuto puede aplicarse también en períodos mucho más cortos. Una ráfaga de solicitudes puede generar errores aunque el promedio final parezca estar bajo el máximo.

Distribuye las solicitudes

Evita enviar todas las llamadas simultáneamente. Utiliza colas, control de concurrencia y distribución temporal.

Optimización

Prompts largos también pueden causar rate limits

Una aplicación puede alcanzar TPM incluso con pocas solicitudes.

01

Elimina instrucciones que se repiten innecesariamente.

02

Evita reenviar contexto que el modelo ya no necesita.

03

Reduce ejemplos redundantes dentro del prompt.

04

Limita la salida al tamaño realmente necesario.

Output limits

No configures salidas enormes si no las necesitas

Los parámetros de salida también influyen en la estimación de consumo.

API Parámetro
Responses API max_output_tokens
Chat Completions max_completion_tokens
Incluye reasoning

En modelos de razonamiento, estos límites deben contemplar tanto los tokens internos de razonamiento como la salida visible.

Publicidad
Too Many Requests

Error 429 en OpenAI API

El código 429 tiene varias causas posibles y cada una requiere una solución distinta.

Error / código Qué significa Qué hacer
Rate limit reached Superaste solicitudes o tokens permitidos Reduce ritmo y aplica reintentos
credit_balance_exhausted No quedan créditos prepagados Agregar saldo
organization_usage_limit_exceeded Se alcanzó el límite de uso aprobado Solicitar aumento
organization_spend_limit_exceeded La organización alcanzó su límite de gasto Aumentar, eliminar o esperar reset
project_spend_limit_exceeded El proyecto alcanzó su límite de gasto Modificar el límite del proyecto
No reintentes errores de facturación indefinidamente

Reintentar una solicitud no recuperará el acceso si el problema es saldo, límite de gasto o límite de uso. Primero debes resolver esa condición.

Reintentos

Exponential backoff para errores temporales

Cuando el 429 corresponde realmente a un rate limit temporal, no conviene repetir inmediatamente la misma solicitud.

01

Espera un período antes del primer reintento.

02

Incrementa progresivamente el tiempo de espera tras cada fallo.

03

Añade variación aleatoria para evitar que muchos clientes reintenten al mismo tiempo.

04

Establece un máximo de reintentos.

05

Registra el error si después de varios intentos continúa fallando.

Los intentos fallidos también consumen capacidad

Reintentar agresivamente puede empeorar la situación en lugar de solucionarla.

Spend limits

Límites de gasto y alertas

OpenAI distingue entre alertas y límites máximos de gasto.

Control Comportamiento
Alerta de gasto Notifica, pero no necesariamente detiene el tráfico
Límite máximo de gasto Puede detener solicitudes cuando se alcanza
Límite de organización Abarca el gasto de sus proyectos
Límite de proyecto Afecta el tráfico facturado a ese proyecto
El gasto registrado puede tener retraso

Los cambios y mediciones no siempre son instantáneos, por lo que puede existir una pequeña diferencia antes de que el límite se aplique completamente.

Publicidad
Batch API

Batch tiene capacidad en cola propia

Los modelos pueden publicar un Batch queue limit separado de RPM y TPM.

Batch queue

Capacidad asincrónica

Cuando utilizas Batch, el modelo puede imponer un máximo de trabajo o tokens pendientes según tu usage tier.

Ideal para cargas no urgentes

Batch puede ser útil para procesamiento masivo cuando no necesitas una respuesta interactiva inmediata.

Escalamiento

Cómo reducir el riesgo de alcanzar los límites

Una arquitectura eficiente puede soportar mucho más tráfico utilizando la misma capacidad.

01

Usa colas: distribuye solicitudes a lo largo del tiempo.

02

Controla concurrencia: evita picos innecesarios.

03

Reduce contexto: elimina información que el modelo no necesita.

04

Limita salida: evita reservar miles de tokens para respuestas cortas.

05

Model routing: utiliza Luna para tareas simples y Sol para casos complejos.

06

Batch: mueve tareas no urgentes fuera del flujo interactivo.

Optimización de modelos

El modelo elegido también afecta la capacidad disponible

Una estrategia de routing permite reservar modelos más costosos y limitados para tareas realmente difíciles.

Modelo Uso recomendado
GPT-5.6 Luna Clasificación, extracción y alto volumen
GPT-5.6 Terra Análisis general y workloads intermedios
GPT-5.6 Sol Trabajo profesional complejo
GPT-6 Astra Trabajos end-to-end de máxima dificultad
Menos presión sobre el flagship

Enviar todas las solicitudes al modelo más potente puede aumentar costos y consumir capacidad innecesariamente.

Comparar modelos ChatGPT →
Dashboard

Dónde ver tus límites actuales

Los valores reales disponibles para tu cuenta deben revisarse directamente en la plataforma.

Limits

Página Limits de la organización

Allí puedes consultar tu usage tier y los límites aplicables actualmente a tu organización.

Abrir página Limits →
Comprueba también el proyecto

Si utilizas varios proyectos, revisa que la solicitud esté usando la organización y el proyecto correctos.

Más capacidad

Cómo aumentar los límites de OpenAI API

El aumento depende del usage tier, historial de gasto y opciones disponibles para la organización.

01

Revisa primero el límite exacto que estás alcanzando.

02

Comprueba tu usage tier actual.

03

Verifica si existen opciones de aumento en la página Limits.

04

Si el problema es un spend limit, modifica ese control en lugar del rate limit.

05

Si el problema persiste, contacta soporte con los datos del error.

Diagnóstico

Qué guardar si necesitas contactar soporte

Un reporte completo facilita identificar el límite que está causando el problema.

01

Mensaje de error exacto.

02

Código o error.code.

03

Request ID cuando esté disponible.

04

Fecha y hora junto con zona horaria.

05

Organización, proyecto y modelo utilizados.

06

Pasos que ya intentaste para solucionar el problema.

Nunca envíes tu API key

No incluyas claves API ni otros secretos de autenticación en una solicitud de soporte.

Fuente oficial

Documentación oficial sobre rate limits

OpenAI actualiza sus límites y controles de capacidad, por lo que la plataforma debe considerarse la referencia final.

OpenAI Help Center

Rate limits y errores 429

La guía oficial explica cómo identificar límites de solicitudes, créditos, gasto y usage tiers.

Consultar documentación oficial →
Publicidad
Sigue aprendiendo

Guías relacionadas con OpenAI API

Continúa con precios, modelos y uso de la plataforma.

Publicidad
Preguntas frecuentes

FAQ sobre los límites de OpenAI API

Respuestas rápidas sobre RPM, TPM, errores 429, gasto y usage tiers.

RPM significa requests per minute y limita la cantidad de solicitudes que pueden realizarse durante un minuto.

TPM significa tokens per minute y controla la cantidad de tokens procesados durante un período determinado.

Puede significar un rate limit temporal, saldo prepagado agotado o un límite de uso o gasto.

No necesariamente. Los límites pueden aplicarse a nivel de organización o proyecto, por lo que varias claves pueden compartir capacidad.

Son niveles de uso que influyen en la capacidad disponible para muchos modelos.

Revisa la página Limits de tu organización. OpenAI también puede aumentar automáticamente el usage tier a medida que crece tu gasto en API.

Los límites pueden aplicarse en intervalos más pequeños que un minuto. Una ráfaga breve puede generar un error aunque el promedio parezca estar bajo el límite.

No. Si el error corresponde a un rate limit temporal, utiliza exponential backoff. Si corresponde a saldo, gasto o límite de uso, debes resolver primero esa condición.

No. Los límites de gasto, uso aprobado y rate limits son controles diferentes.

Publicidad
Siguiente guía

Continúa con los precios de OpenAI API

Ya conoces los límites. El siguiente paso es entender cuánto cuestan los modelos, tokens, cache y herramientas.

Ver precios de OpenAI API →
Carrito de compra
Scroll al inicio