Promptea.

Cómo depurar un prompt que da resultados malos

Un método sistemático para diagnosticar por qué falla un prompt y corregirlo sin prueba y error.

Los modos de falla más comunes
  • Objetivo faltante: describiste la tarea pero no cómo se ve el éxito — el modelo adivina los criterios de aceptación.
  • Alcance ambiguo: 'breve' significa 50 palabras para vos y 500 para el modelo. Especificá números.
  • Contexto faltante: el modelo no tiene las restricciones, definiciones o antecedentes que hacen que la tarea sea inequívoca en tu cabeza.
  • Formato incorrecto: querés una tabla, el modelo da prosa. Querés JSON, el modelo agrega fences de markdown.
  • Instrucciones contradictorias: 'sé conciso' más 'cubrí todo' en el mismo prompt producen basura promediada.
  • Sin ancla para información faltante: cuando el modelo no sabe algo, llena el hueco. Decirle que marque los huecos previene alucinaciones.
El proceso de depuración
  • Paso 1 — aislá el síntoma: anotá exactamente qué salió mal. 'Demasiado largo', 'formato incorrecto', 'hechos inventados', 'se fue por las ramas', 'inconsistente entre corridas'.
  • Paso 2 — encontrá la instrucción faltante: por cada síntoma, preguntate '¿qué necesitaría decirle a un humano capaz para prevenir esto?' Esa instrucción faltante es lo que va en el prompt.
  • Paso 3 — agregá un fix a la vez: cambiá una sola variable por corrida para saber qué realmente lo arregló. Múltiples cambios a la vez hacen imposible saber cuál funcionó.
  • Paso 4 — testeá con casos límite: corrés el prompt corregido en una versión más difícil de la tarea, un input corto, uno largo y uno con datos faltantes. Los prompts reales tienen que manejar todo esto.
  • Paso 5 — bloqueá lo que funciona con un ejemplo de formato: una vez que el output es correcto, agregá un ejemplo de una línea del formato exacto que querés. Previene la deriva cuando reutilizás el prompt.
Plantillas
Auto-diagnóstico de prompt
Sos un revisor de calidad de prompts. Analizá el siguiente prompt e identificá las 3 razones principales por las que podría dar resultados malos.

Por cada problema:
1. Nombrá el modo de falla (ej. "restricción de formato faltante", "alcance ambiguo", "sin ancla para información faltante").
2. Citá la parte exacta del prompt que lo causa.
3. Escribí un fix de 1 oración.

Después reescribí el prompt completo con los tres fixes aplicados.

Prompt a revisar:
"""
[pegá el prompt que está dando resultados malos]
"""
Se abre en la home con el prompt precargado.
Abrir en Promptea
Comparación de outputs: ¿qué cambió?
Comparé estos dos outputs de prompt y explicá qué cambio de instrucción produciría el output B en lugar del output A.

Output A (malo):
"""
[pegá el output malo]
"""

Output B (bueno):
"""
[pegá un ejemplo del output que realmente querés]
"""

Enfocate en:
- ¿Qué regla de formato de output faltaba en el prompt que generó A?
- ¿Qué restricción o ejemplo haría que A fuera imposible y B predecible?
- Escribí el agregado mínimo al prompt original (1–3 líneas) que cierra la brecha.
Se abre en la home con el prompt precargado.
Abrir en Promptea
Preguntas frecuentes
¿Por qué mi prompt a veces funciona y a veces no?
Los outputs inconsistentes generalmente significan que el prompt tiene ambigüedad que el modelo resuelve de manera diferente cada vez — sin una interpretación correcta única, elige una al azar. El fix es reducir la ambigüedad: especificá el formato con un ejemplo, restringí el alcance con números y eliminá instrucciones contradictorias. Cuando la consistencia estricta importa, también bajá la configuración de temperatura del modelo si la controlás, o bloqueá el output a un JSON schema cuando haya uno disponible.
¿Cuántas iteraciones suele llevar arreglar un prompt?
La mayoría de los problemas de prompts se arreglan en 2–3 iteraciones cuando cambiás una cosa a la vez. Los errores comunes que lo prolongan: cambiar múltiples cosas a la vez (así no podés saber qué funcionó), testear solo en el input original (sin casos límite), y arreglar síntomas en lugar de causas raíz. Un prompt que maneja de manera confiable 5 inputs diversos está genuinamente arreglado. Uno que pasa solo el caso de test original se va a romper en producción.