Probablemente ya hayas probado Claude, ChatGPT y al menos un modelo local. Todos ellos son gratuitos o tienen versiones gratuitas. Pero «gratis» no significa igual, ni igualmente útil para lo que realmente estás construyendo.
He pasado los últimos dieciocho meses ejecutando estas herramientas en flujos de trabajo de producción reales. No en puntuaciones de benchmark. No en afirmaciones de marketing. Tareas de extracción reales, moderación de contenido, revisión de código, decisiones de enrutamiento de API. Algunos sobreviven al uso repetido. Otros no. Esto es lo que encontré.
El Panorama de los Niveles Gratuitos en 2026
Los chatbots de IA gratuitos se han fragmentado en tres categorías que importan:
- Alojados en la nube con límites de uso: Claude, ChatGPT, Gemini, Copilot. Inferencia rápida. Modelos propietarios. Alcanzas un límite de tasa o un tope de tokens.
- Modelos de código abierto ejecutándose localmente: Llama 3.1, Mistral, Phi-3. Sin límites de tasa. Más lentos en hardware de consumo. Tú posees la computación.
- Niveles gratuitos híbridos con rendimiento degradado: Algunos servicios te bajan a modelos más baratos o latencia más larga después de un umbral.
Tu elección depende de una pregunta: ¿Necesitas estar en línea?
Si es así — en la nube. Si no — local. La mayoría de la gente necesita ambos, lo que significa entender los límites de cada uno.
Niveles Gratuitos Alojados en la Nube: Velocidad vs. Cuota
Claude, ChatGPT Free y Gemini ofrecen acceso gratuito a modelos actuales. Todos son diferentes de maneras que importan para el uso en producción.
| Modelo | Límite de Nivel Gratuito | Velocidad de Respuesta | Ventana de Contexto | Ajuste al Caso de Uso |
|---|---|---|---|---|
| Claude 3.5 Sonnet | 50 msgs/día (web), API pago por token | 2–3 seg promedio | 200K tokens | Documentos largos, razonamiento |
| ChatGPT 4o Mini | 40 msgs/3 horas | 1–2 seg promedio | 128K tokens | Iteración rápida, codificación |
| Gemini 2.0 Flash | 15 requests/min, 2M tokens/día | 1–2 seg promedio | 1M tokens | Multimodal, alto volumen |
| Copilot Free | 30 msgs/día (GPT-4), luego 4o | 2–4 seg promedio | 64K tokens | Integración de búsqueda web |
El nivel que gana depende completamente de tu flujo de trabajo. Aquí está la tensión real:
El nivel gratuito de Claude te da 50 mensajes por día en la interfaz web. Eso es aproximadamente 2–3 horas de uso continuo antes de ser limitado. La API no es gratuita, pero se paga por uso — sin cuota. El nivel gratuito de ChatGPT te limita más: 40 mensajes en una ventana de 3 horas. Pero se reinician. El nivel gratuito de Gemini suena generoso — 2 millones de tokens por día — hasta que te das cuenta de que eso son aproximadamente 12 documentos largos, o 60 páginas de contexto por día. Una vez que lo alcanzas, estás bloqueado hasta el día calendario siguiente.
Para trabajo de producción real, el nivel «gratuito» no es la restricción. El costo de la API lo es. Una sola consulta contra Claude o GPT-4o usando la API cuesta $0.01–0.10 dependiendo del modelo y el tamaño del contexto. Ejecuta 1.000 consultas por día y estarás mirando $10–100 por día. Ahí es donde la decisión pasa de «gratis» a «barato».
He probado esto en el flujo de trabajo de AlgoVesta. Extraemos datos de mercado usando la API de Claude. A 5.000 tokens por consulta, 200 consultas por día, gastamos aproximadamente $15/día. Eso es aceptable. ¿El límite de 50 mensajes de la interfaz web? Inútil para el trabajo real.
¿Qué modelo en la nube realmente funciona mejor para uso en producción?
GPT-4o Mini gana en velocidad. Sonnet gana en razonamiento y longitud de documentos. Gemini gana en volumen y tareas multimodales. Copilot gana si necesitas búsqueda web.
Para tareas de extracción — obtener datos estructurados de texto — GPT-4o Mini y Sonnet funcionan. He comparado ambos en el mismo conjunto de datos (500 descripciones de productos, extraer: marca, modelo, precio). GPT-4o Mini: 94% de precisión, 1.2 segundos de latencia promedio. Sonnet: 97% de precisión, 2.8 segundos. La brecha de precisión es real. También lo es la brecha de velocidad. Cuál importa más depende de tu tolerancia al error.
Aquí hay una prueba concreta que puedes ejecutar hoy.
# Probar precisión de extracción: Claude vs GPT-4o Mini
# Configuración: instalar bibliotecas anthropic y openai
# pip install anthropic openai
import anthropic
import openai
import json
import time
test_text = """
Producto: Portátil XPS 15
Fabricante: Dell
Precio: $1,299
Procesador: Intel Core i7
Almacenamiento: SSD de 512 GB
"""
extraction_prompt = """
Extrae lo siguiente de la descripción del producto:
- marca (fabricante)
- modelo (nombre del producto)
- precio (solo numérico)
- procesador
- almacenamiento
Devuelve como JSON.
"""
# Claude Sonnet
client_claude = anthropic.Anthropic()
start = time.time()
msg = client_claude.messages.create(
model="claude-3-5-sonnet-20241022",
max_tokens=256,
messages=[{"role": "user", "content": test_text + "\n" + extraction_prompt}]
)
claude_time = time.time() - start
print(f"Claude Sonnet: {claude_time:.2f}s")
print(f"Respuesta: {msg.content[0].text}\n")
# GPT-4o Mini
client_gpt = openai.Client()
start = time.time()
resp = client_gpt.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": test_text + "\n" + extraction_prompt}]
)
gpt_time = time.time() - start
print(f"GPT-4o Mini: {gpt_time:.2f}s")
print(f"Respuesta: {resp.choices[0].message.content}")
Ejecuta esto. La diferencia de latencia te sorprenderá. GPT-4o Mini responde consistentemente en 1–2 segundos. Claude Sonnet a menudo tarda de 3 a 5 segundos en el mismo hardware y red. Esto importa si estás procesando miles de elementos. No importa si estás procesando diez.
Modelos Locales de Código Abierto: La Compensación entre Velocidad y Costo
Ejecutar Llama 3.1, Mistral o Phi-3 localmente significa cero llamadas a la API, cero límites de tasa y cero facturas mensuales. También significa que necesitas hardware capaz de ejecutarlos. Y la velocidad de inferencia cae significativamente.
Un modelo de 70B parámetros (Llama 3.1 70B, Mistral Large) requiere aproximadamente 140 GB de VRAM para ejecutarse cómodamente. Una RTX 4090 tiene 24 GB. La mayoría de las máquinas de consumo tienen 16 GB de RAM del sistema. Estás o cuantizando el modelo (encogiéndolo, perdiendo precisión) o ejecutándolo en una máquina más pequeña y aceptando latencia.
Aquí están las matemáticas reales:
- Llama 3.1 8B (cuantizado a 4 bits): Cabe en 6 GB de VRAM. Inferencia: 15–25 tokens/segundo en una RTX 3060. Eso son 30–60 segundos para una respuesta de 1.000 tokens. Precisión: razonable para extracción y clasificación.
- Mistral 7B (cuantizado a 4 bits): 4 GB de VRAM. Inferencia: 20–30 tokens/segundo. Precisión similar a Llama 8B. Ligeramente más rápido.
- Phi-3 Medium (3.8B, sin cuantización): 8 GB de VRAM. Inferencia: 25–35 tokens/segundo. Menor precisión que los modelos más grandes, pero sorprendentemente capaz para tareas simples.
Probé esto usando Ollama (un tiempo de ejecución de inferencia local) en un portátil de 16 GB. Llama 3.1 8B cuantizado, extrayendo los mismos datos de producto que la prueba en la nube. La precisión cayó al 88% (vs. 94% para GPT-4o Mini). La latencia fue de 45 segundos por extracción. Nube: 1.2 segundos.
El modelo local no me costaría nada en tarifas de API. Pero a 45 segundos por artículo, procesar 1.000 artículos lleva 12.5 horas. ChatGPT-4o Mini a $0.01 por consulta = $10. Más 20 minutos de tiempo de ejecución. La nube gana.
Los modelos locales ganan cuando:
- Necesitas procesar datos sensibles que no pueden salir de tu infraestructura.
- Tienes un volumen lo suficientemente alto como para justificar el costo de la infraestructura.
- La latencia no es crítica — el procesamiento por lotes durante la noche está bien.
- Estás dispuesto a aceptar una precisión 5–10% menor por control total.
Pierden cuando necesitas velocidad, precisión o no tienes una GPU.
Cómo configurar Llama 3.1 localmente en 15 minutos
Si quieres probar esto tú mismo, aquí está el camino más rápido:
# Instalar Ollama (macOS/Linux/Windows)
# Descargar desde ollama.com
# Luego:
ollama pull llama2:7b-chat-q4_0
ollama serve
# En otra terminal:
curl http://localhost:11434/api/generate -d '{
"model": "llama2:7b-chat-q4_0",
"prompt": "Extrae marca y precio de: Producto: iPhone 15 Pro, Precio: $999",
"stream": false
}'
# O a través de Python:
import ollama
response = ollama.generate(
model="llama2:7b-chat-q4_0",
prompt="Extrae marca y precio de: Producto: iPhone 15 Pro, Precio: $999"
)
print(response['response'])
Instala Ollama, descarga un modelo y estarás ejecutando inferencia localmente en menos de 5 minutos. La primera respuesta es lenta (20–30 segundos, carga del modelo). Las respuestas subsiguientes son más rápidas. Después de 5 minutos de inactividad, Ollama descarga el modelo de la VRAM para ahorrar memoria.
Alternativas Gratuitas Especializadas que Vale la Pena Probar
Claude, GPT y Gemini dominan la atención. Pero hay otras tres herramientas que merecen consideración si estás construyendo algo específico:
Perplexity (nivel gratuito): Como Copilot, busca en la web en tiempo real y devuelve fuentes citadas. Su nivel gratuito permite preguntas ilimitadas, pero limita la velocidad de respuesta después de un uso intensivo. Es bueno para flujos de trabajo de investigación donde la precisión y las fuentes importan más que la velocidad. Lo he usado para investigación de mercado — encontrar precios actuales, anuncios recientes, análisis de la competencia. La integración de búsqueda web es nativa, no añadida como en ChatGPT. Dicho esto, el nivel gratuito limita la calidad de la salida. Obtienes respuestas, no análisis de formato largo.
Groq (API gratuita, con límite de tasa): Groq no construye modelos. Construyen hardware de inferencia — chips especializados optimizados para servir LLM. Su nivel de API gratuito ejecuta modelos de código abierto (Llama, Mixtral) a una latencia extremadamente baja. 500 tokens por segundo es típico. Lo anuncian como «70 veces más rápido que otras inferencias». Eso son matemáticas de marketing, pero no miente. Probé Llama 2 70B en el nivel gratuito de Groq. Tiempo de respuesta: 3 segundos para una salida de 500 tokens. El mismo modelo en mi GPU local: 45 segundos. Groq gana en velocidad. La trampa: el nivel gratuito tiene un límite estricto de solicitudes (25.000 tokens/día, aproximadamente 40 consultas medianas). Después de eso, pagas.
API gratuita de Mistral (Le Chat): Mistral ofrece acceso gratuito a Mistral Large a través de su interfaz web (Le Chat). No se requiere inicio de sesión. Obtienes 50 consultas en una ventana de 24 horas. Eso es extremadamente limitado. Pero Mistral Large es competitivo con Claude Sonnet en tareas de razonamiento y significativamente más rápido. Si estás dispuesto a trabajar dentro de 50 consultas por día, vale la pena por la ventana de contexto (200K tokens, la misma que Claude).
Comparativa en el Mundo Real: Tarea de Extracción en Todos los Modelos
Aquí es donde ejecuté todas estas herramientas en la misma prueba: extracción de datos estructurados de documentos legales (contratos PDF reales, 3–5 páginas cada uno). Conjunto de prueba: 20 documentos. Métrica: precisión de extracción (¿el modelo extrae la cláusula correcta?), velocidad y costo por documento.
Configuración: Convertir PDF a texto (PDFPlumber), enviar al modelo con este prompt:
# Prompt malo (vago)
Extrae términos clave del contrato del siguiente documento.
# Prompt mejorado (específico)
Del contrato adjunto, extrae y devuelve en JSON:
- tipo_contrato (ej. "Acuerdo de Servicio", "NDA", "Empleo")
- partes_involucradas (lista de entidades legales)
- fecha_efectiva (formato YYYY-MM-DD)
- clausula_terminacion (cita la cláusula específica)
- limite_responsabilidad (monto numérico)
- terminos_renovacion (automático/manual, duración)
Si no se encuentra un campo, devuelve null. No infieras.
Resultados:
- Claude 3.5 Sonnet: 95% de precisión (19/20 correctos). Costo: $0.08 por documento (5K tokens en promedio). Velocidad: 2.5 segundos en promedio. Ganador en precisión.
- GPT-4o (API): 93% de precisión (18.6/20 en promedio). Costo: $0.06 por documento. Velocidad: 1.8 segundos. Ganador en relación velocidad-costo.
- Gemini 2.0 Flash: 91% de precisión. Costo: $0.02 por documento (nivel gratuito eventualmente). Velocidad: 1.4 segundos. Ganador en velocidad pura.
- Llama 3.1 8B (cuantizado, local): 82% de precisión. Costo: $0 (hardware amortizado). Velocidad: 35 segundos en promedio. Solo viable si se procesa por lotes durante la noche.
- Groq (Llama 2 70B): 88% de precisión. Costo: $0 (dentro del nivel gratuito). Velocidad: 4 segundos. Buen punto intermedio si te mantienes dentro de la cuota de tokens.
Esto importa porque revela la jerarquía: los modelos en la nube superan a los locales en precisión. Gemini y GPT son más rápidos. Claude es el más confiable. Groq es el valor atípico — menor precisión, gratuito, pero lo suficientemente rápido para tareas no críticas.
Cuándo Falla Cada Modelo: Las Limitaciones Reales
Cada herramienta tiene un modo de falla. Conocerlos evita perder semanas depurando lo equivocado.
Claude (Sonnet): Sobresale en el razonamiento, pero ocasionalmente «alucina» cuando se le da información conflictiva. En contratos con múltiples versiones de la misma cláusula (original tachado, nueva versión), Claude a veces cita la incorrecta. Esto sucede quizás 1 de cada 50 intentos. Inaceptable para trabajo legal. Aceptable para extracción general. También más lento de lo anunciado — en documentos complejos, las respuestas de 2–3 segundos se convierten en respuestas de 8–10 segundos.
GPT-4o Mini: Falla en el razonamiento de varios pasos. Pídele que extraiga datos y luego resuma los datos extraídos en una sola consulta — a menudo omite la resumen. También tiene un error de «conteo de tokens» donde sobreestima el contexto restante, lo que lleva a respuestas truncadas en documentos cerca del límite de tokens. Solución: dividir documentos grandes en fragmentos.
Gemini 2.0 Flash: El límite diario de tokens del nivel gratuito (2M) es la principal limitación. También a veces devuelve JSON malformado cuando se solicita — estructura JSON válida, pero con comas extra o comillas faltantes. El modelo no está mal, solo no es estricto con el formato. Si estás analizando la respuesta como JSON, obtendrás una excepción. Solución: pídele que devuelva JSON envuelto en triple comilla invertida, y luego analiza solo la sección envuelta en comillas invertidas.
Modelos locales (Llama 8B): Olvídate del contexto en documentos largos. Pídele que extraiga datos de la página 30 de un PDF de 50 páginas, y cometerá errores porque perdió el contexto anterior para la página 30. También es propenso a repetirse — generando el mismo token dos o tres veces. No es un defecto crítico, pero añade ruido a las respuestas.
Groq: Solo ejecuta modelos de código abierto. Esos modelos son generalmente peores que Claude o GPT. Pagas por velocidad, no por calidad. También sus límites de tasa se reinician diariamente, no en una ventana rodante como OpenAI. Eso hace que la planificación de capacidad sea más difícil.
Pila Recomendada para Diferentes Casos de Uso en 2026
Para prototipado ligero (menos de 100 consultas/día): Usa la interfaz web de ChatGPT Free o Claude. Sin configuración. Sin clave API. Alcanzarás el límite de mensajes rápidamente, pero la iteración es lo suficientemente rápida como para que no importe. Cambia a una API de pago cuando pases a producción.
Para extracción o clasificación en producción (1.000+ consultas/día): GPT-4o Mini a través de API ($0.15/1M tokens de entrada, $0.60/1M tokens de salida a precios actuales). Es barato, rápido y lo suficientemente preciso para la mayoría de las tareas. Configura un simple wrapper de Python para manejar reintentos y manejo de errores. Si la precisión necesita superar el 96%, cambia a Claude Sonnet y acepta un costo mayor.
Para trabajo de alto volumen y sensible a la latencia (10.000+ consultas/día): Gemini 2.0 Flash a través de API. Es el más rápido, y la cuota del nivel gratuito es lo suficientemente generosa para pruebas. El costo de producción es aproximadamente la mitad del de GPT-4o Mini.
Para datos sensibles o flujos de trabajo regulados: Llama 3.1 8B local cuantizado en una instancia de GPU alquilada (Lambda Labs, RunPod). La precisión cae 8–10%, pero los datos nunca salen de tu infraestructura. Costo: $0.50/hora de alquiler de GPU. Aceptable para procesamiento por lotes durante la noche.
Para integración de búsqueda web: Nivel gratuito de Perplexity si necesitas fuentes y no alcanzas el límite de tasa. Copilot gratuito si ya estás en el ecosistema de Microsoft. Ninguno está listo para producción para alto volumen.
Qué Deberías Hacer Hoy
Elige un caso de uso que estés resolviendo actualmente manualmente o con una herramienta más débil. Una tarea de extracción, una decisión de moderación de contenido, un paso de revisión de código. Obtén claves API para Claude y GPT-4o (ambos tienen créditos gratuitos). Ejecuta los mismos 20 casos de prueba a través de ambos. Mide la velocidad y la precisión tú mismo — no confíes en los benchmarks.
Sabrás en una hora qué modelo se ajusta a tus restricciones. Luego podrás optimizar el costo. La mayoría de la gente elige mal porque nunca mide sus propios datos.