Una matriz simple para auditar la calidad de los prompts que usa tu equipo. Saca un score por dimensión.
Cuando un equipo lleva un tiempo utilizando IA, suele aparecer una diferencia difícil de explicar.
Cada persona desarrolla su propia manera de pedir las cosas. Algunas instrucciones funcionan bien casi siempre. Otras necesitan varios intentos. Y otras solo dan buen resultado cuando las utiliza quien las escribió.
El equipo percibe que unos prompts funcionan mejor que otros, pero no siempre sabe identificar por qué.
Esta matriz sirve para revisar los prompts que se utilizan de verdad, puntuarlos por dimensiones y detectar qué les falta. No pretende convertir la escritura de prompts en una ciencia exacta. Es una forma sencilla de hacer visible lo que hoy depende de la intuición de cada persona.
El objetivo no es encontrar el prompt perfecto. Es entender qué hace que una instrucción sea clara, reutilizable y suficientemente completa para que otra persona pueda obtener un resultado parecido.
Si prefieres que la evaluación la haga un modelo con esta misma matriz, existe la versión automática: el Evaluador de prompts.
Recopila entre 5 y 10 prompts reales del equipo. Los que se usan a diario, no los bonitos. Pasa cada uno por la matriz y puntúa cada dimensión de 0 a 2:
La puntuación máxima es 12. Pero el número total importa menos que el patrón: un equipo entero suspendiendo en la misma dimensión te dice exactamente qué formar.
| Dimensión | Qué mide | Pregunta de control | Score |
|---|---|---|---|
| 01 · Objetivo | Si el prompt pide una cosa concreta | ¿Se puede saber si el resultado es correcto sin preguntar a quien lo escribió? | 0-2 |
| 02 · Contexto | Lo que el modelo necesita saber y no sabe | ¿Incluye la situación, el negocio, el destinatario? ¿O asume que el modelo adivina? | 0-2 |
| 03 · Formato de salida | La forma esperada del resultado | ¿Especifica estructura, extensión, tono, idioma? | 0-2 |
| 04 · Datos y ejemplos | Material de trabajo real | ¿Aporta el documento, los datos o un ejemplo de resultado bueno? | 0-2 |
| 05 · Límites | Lo que NO debe hacer | ¿Marca qué evitar, qué no inventar, qué queda fuera del alcance? | 0-2 |
| 06 · Reutilización | Si sirve más de una vez | ¿Otra persona del equipo podría usarlo mañana cambiando solo los datos? | 0-2 |
De 0 a 5. El prompt es una frase suelta. Los resultados dependen de la suerte y de cuántas veces se repita el intento. Es el punto de partida de la mayoría de equipos, no es un drama: es la línea base.
De 6 a 9. Hay oficio, falta método. Suele fallar siempre lo mismo: límites (nadie dice al modelo lo que no debe hacer) y reutilización (cada prompt se escribe desde cero cada vez).
De 10 a 12. El prompt es un activo del equipo. Merece nombre, dueño y sitio en una biblioteca compartida. Aquí empieza otra conversación: cuáles de estos prompts merecen convertirse en algo más —una automatización, un agente— y cuáles están bien como están.
Al revisar prompts de trabajo, hay tres problemas que aparecen una y otra vez. No están presentes en todos los equipos ni tienen siempre la misma importancia, pero son un buen punto de partida para detectar dónde se pierde calidad.
Contexto asumido. La persona conoce tan bien su tarea que no percibe toda la información que está dejando fuera. "Prepara el informe de siempre" puede ser suficiente entre compañeros que llevan años trabajando juntos. Para un modelo, no lo es.
Límites poco claros. Se explica qué debe hacer el modelo, pero no qué debe evitar ni cómo debe actuar cuando falta información. Después aparece una cifra no verificada, una suposición o una respuesta demasiado segura, y el problema se atribuye al modelo sin revisar primero la instrucción.
Prompts difíciles de reutilizar. Una misma tarea se resuelve cada vez desde cero, con instrucciones distintas según la persona y el momento. El resultado no solo cambia de calidad: también cambia de formato, criterio y nivel de detalle.
Una biblioteca compartida puede ayudar, pero únicamente si contiene prompts realmente utilizados, tiene una persona responsable y se revisa cuando cambia el proceso. Una carpeta llena de instrucciones antiguas no es un activo. Es otro lugar en el que buscar.
Esta matriz evalúa la calidad del prompt. No determina por sí sola si el resultado será bueno ni si la tarea debería resolverse con IA.
Un prompt puede obtener 12 puntos y seguir fallando porque los datos son incompletos, el modelo no es adecuado, la tarea está mal definida o nadie sabe cómo validar la respuesta.
También puede estar perfectamente escrito y aplicarse a un problema que se resolvería mejor con una plantilla, una regla fija o una automatización convencional.
Por eso, una puntuación alta no es una autorización para automatizar.
Esta herramienta responde a una pregunta concreta: ¿estamos dando al modelo una instrucción clara, completa y reutilizable?
Antes queda otra pregunta más importante: ¿este problema merece realmente una solución de IA?
Para responderla, puedes utilizar el recurso Cómo decidir si un caso de uso merece IA, disponible en esta misma sección.