Promptea.

Cómo escribir prompts para IA con imágenes y archivos (multimodal)

Los prompts multimodales combinan instrucciones de texto con imágenes, PDFs o capturas de pantalla. Aprendé a dirigir la atención de la IA a lo que importa y extraer salida estructurada de forma confiable.

Qué pueden y no pueden hacer los modelos de IA multimodal
  • Pueden: describir el contenido de imágenes, leer texto en imágenes (tipo OCR), extraer datos de tablas y formularios, analizar gráficos y diagramas, comparar múltiples imágenes y responder preguntas basadas en lo que ven.
  • No pueden: leer de forma confiable texto muy pequeño en imágenes de baja resolución, contar objetos con precisión en escenas densas, ni garantizar precisión a nivel de píxel en diagramas complejos.
  • La calidad de la salida depende mucho de la resolución y claridad de la imagen. Las imágenes borrosas o de bajo contraste producen descripciones vagas.
  • Para PDFs: algunas APIs los aceptan directamente; otras requieren convertir páginas a imágenes primero. Revisá la documentación de tu modelo.
Cómo dirigir la atención de la IA en imágenes
  • Nombrá lo que querés analizar: 'Enfocate en el gráfico de barras en la esquina superior derecha' es más claro que 'analizá esta imagen'.
  • Describí qué contiene la imagen si el modelo podría no reconocer el contexto: 'Esta es una captura de pantalla de un dashboard de gestión de almacenes mostrando niveles de inventario.'
  • Para documentos y formularios, especificá qué campos importan: 'Extraé solo el nombre del proveedor, número de factura, fecha y monto total. Ignorá los ítems de línea.'
  • Usá anclajes espaciales: 'la tabla en la segunda columna', 'la fila resaltada', 'la leyenda en la parte inferior'.
  • Si la imagen tiene múltiples elementos, decile al modelo qué priorizar primero y qué omitir.
Errores comunes en prompts multimodales
  • Sin descripción de la imagen: preguntar '¿qué muestra esto?' sin contexto fuerza al modelo a adivinar el propósito. Decile qué tipo de documento o imagen estás enviando.
  • Esperar precisión en entradas desordenadas: una foto de una nota manuscrita tomada en ángulo con poca luz producirá resultados inciertos — escaneá o recortá antes de hacer el prompt.
  • Sin formato de salida especificado: sin uno, el modelo podría describir la imagen en prosa cuando necesitabas JSON, o darte una tabla cuando necesitabas un resumen.
  • Asumir que lee todo el texto: los modelos procesan imágenes como patrones visuales. Texto muy pequeño, rotado o sobre fondos complejos puede ser omitido o mal leído.
Templates
Extracción de datos visuales de una imagen o captura de pantalla
Te envío [una captura de pantalla de un dashboard / una foto de un formulario / una imagen de un gráfico].

Contexto: [describí qué contiene la imagen y de dónde viene — ej. "Esta es una captura de pantalla del reporte semanal de ventas de nuestra herramienta interna de reporting."]

Extraé los siguientes campos:
- [Campo 1]: [cómo se ve o dónde aparece]
- [Campo 2]: [cómo se ve o dónde aparece]
- [Campo 3]: [cómo se ve o dónde aparece]

Devolvé SOLO JSON:
{
  "campo_1": "valor o null",
  "campo_2": "valor o null",
  "campo_3": "valor o null",
  "notas_extraccion": "cualquier incertidumbre o ambigüedad detectada"
}

Reglas:
- Usá null para cualquier campo que no puedas leer claramente.
- No adivines ni infieras valores no visibles en la imagen.
- Agregá una nota en notas_extraccion si algún campo fue difícil de leer.
Se abre en la home con el prompt precargado.
Abrir en Promptea
Preguntas y respuestas sobre un documento con cita de fuente
Te envío [un PDF / un conjunto de imágenes de un documento / un contrato escaneado].

Contexto: [describí brevemente qué es el documento — ej. "Este es un contrato de proveedor para licenciamiento de software, de aproximadamente 12 páginas."]

Respondé las siguientes preguntas basándote SOLO en el contenido visible en el documento:
1. [Tu pregunta 1]
2. [Tu pregunta 2]
3. [Tu pregunta 3]

Para cada respuesta:
- Citá la oración o sección exacta que respalda tu respuesta.
- Si el documento no contiene la respuesta, decí "No encontrado en el documento" — no inferras.
- Si la respuesta es ambigua, explicá por qué y citá el pasaje relevante.

Formato:
**P1:** [replanteá la pregunta]
**Respuesta:** [tu respuesta]
**Fuente:** "[cita textual del documento]" (Página X / Sección Y si es identificable)
Se abre en la home con el prompt precargado.
Abrir en Promptea
Preguntas frecuentes
¿Qué modelos de IA soportan entradas de imagen?
A mediados de 2026, las entradas de imagen son soportadas por GPT-4o y modelos OpenAI posteriores, Claude 3 y modelos Anthropic posteriores, Gemini 1.5 y modelos Google posteriores, y Grok 2 Vision. DeepSeek y Kimi también tienen variantes multimodales. Siempre verificá el soporte de imágenes en la documentación actual del modelo, ya que las capacidades varían por nivel de API y pueden cambiar.
¿Cómo extraigo una tabla de un PDF usando IA?
El enfoque más confiable: convertí la página del PDF que contiene la tabla a una imagen de alta resolución (300 DPI o superior), luego enviala con un prompt que especifique la ubicación de la tabla, las columnas que necesitás y el formato de salida (JSON o tabla Markdown). Pedí al modelo que marque las celdas que no puede leer claramente. Para PDFs nativos digitales donde el texto es seleccionable, copiá y pegá el texto de la tabla directamente en tu prompt — la extracción de texto es más confiable que el OCR visual.