El problema de Midjourney no es el modelo. Deja de escribir prompts perfectos.
Los prompts de texto empujan las imágenes de IA hacia la media y entierran los resultados en hilos de chat. Darle al modelo referencias reales sobre un lienzo compartido resuelve las dos cosas.
Pregúntale a un director creativo qué quiere y no te contestará con un párrafo. Abrirá tres referencias, señalará una esquina de una de ellas y dirá: más así, menos así.
Midjourney no admite eso. Ninguna herramienta de imagen basada en chat lo hace. Te dan una caja de texto y tienes que traducir tu intención a palabras.
Ese es el problema de fondo, y todo lo demás se deriva de ahí.
Las palabras son un formato con pérdidas para el gusto
Un prompt es una compresión de lo que quieres, y la mayor parte de lo que quieres no sobrevive a esa compresión. La luz de esa foto. El grosor exacto de esa serifa. La razón por la que la caja de Prada parece cara y la de al lado no. Puedes escribir cuatrocientas palabras y seguir sin acertar; por eso el prompt engineering acabó siendo un oficio.
Y hay algo peor: todos comprimimos igual. Nadie tiene un vocabulario propio para «cinematográfico», «editorial» o «limpio». Así que mil equipos teclean más o menos los mismos adjetivos en más o menos el mismo modelo y reciben más o menos la misma imagen.
Dylan Field, CEO de Figma, lo explicó sin rodeos en Lenny's Podcast en octubre de 2025: lo primero que te entrega la IA es genérico por definición, porque es el promedio de todo lo que ha visto. Los prompts de texto son justamente lo que te mantiene plantado en ese promedio. Merriam-Webster eligió «slop» como palabra del año 2025, definida como contenido de baja calidad producido en masa por IA. De ahí viene la masa.
Y hay datos sobre lo que esto le hace a un grupo. Anil Doshi y Oliver Hauser publicaron un estudio en Science Advances en 2024 en el que dieron asistencia de IA a un grupo de escritores. Individualmente, los textos asistidos puntuaron más alto. Al compararlos entre sí, se parecían mucho más. Todos mejoraron y todos se homogeneizaron al mismo tiempo.
Qué produce en realidad una buena imagen
No una frase mejor. Mejor material.
Un brief real es un montón de cosas: una foto de referencia, el packaging de un competidor, un informe de mercado, una nota que alguien escribió en una reunión pidiendo que la luz recuerde a un apartamento de Seúl a las seis de la tarde. Cuando puedes darle al modelo esos objetos en lugar de una descripción de esos objetos, el resultado deja de derivar hacia el promedio, porque los inputs son tuyos y nadie más los tiene.
Lo otro que ocurre es más sutil. Reunir las referencias te obliga a averiguar qué quieres decir en realidad. Casi nadie sabe lo que quiere hasta que ve dos opciones una al lado de la otra y nota que prefiere una. Una caja de texto no te da eso. Un muro con tu propio material, sí.
Y luego la herramienta tira el trabajo a la basura
Supongamos que has conseguido una buena imagen. ¿Dónde está?
En un hilo de chat, debajo de otros cuarenta intentos y encima de otros sesenta. Ese hilo es solo tuyo. Nadie más del equipo lo ve.
Piensa en lo que hay dentro de esas cien imágenes. La versión que estaba casi bien pero demasiado cálida. La que falló de una forma interesante. La dirección que el equipo descartó explícitamente y que alguien va a proponer otra vez dentro de tres semanas, porque no queda constancia de que ya se probó. Todo eso tenía valor y todo eso es ahora historial de scroll en la cuenta privada de una sola persona.
El chat es un mal contenedor para el trabajo visual por la misma razón que es un mal contenedor para las decisiones: es una línea. Y una línea no se puede poner al lado de sí misma. Para comparar dos imágenes en Midjourney haces scroll, retienes una en la cabeza, vuelves a subir y finges que las estás comparando. No las estás comparando. Las estás recordando.
Los equipos acaban haciendo lo que siempre hacen cuando una herramienta les falla. Alguien manda capturas de las buenas por Slack. Otro las descarga en una carpeta llamada final_v2. Y en una semana nadie sabe cuál de las cuatro versiones de esa carpeta era la que todos habían aprobado.
Lo que construimos en su lugar

En ALLO, la generación ocurre sobre el lienzo, y los dos problemas se resuelven de una sola vez.
Seleccionas los objetos que quieres que el modelo use. Una imagen de referencia, el packshot de un competidor, un documento de investigación, un post-it con una idea a medio formar: todo ya sobre el tablero, porque ahí es donde vive el proyecto. El prompt se arma con material real en lugar de escribirse de memoria. El modelo recibe tus datos concretos, no tus adjetivos.
El resultado aterriza en el lienzo, junto a lo que lo produjo. No en un hilo. No en una carpeta. Se queda ahí como un objeto, versionado, y puedes ponerlo al lado de los otros cinco y mirarlos juntos de verdad, que es la única forma en la que alguien ha elegido nunca entre imágenes.
Y la cosa sigue. Una nota se convierte en un documento de investigación. El documento, en una infografía. La infografía, en una foto de producto. Alguien pega un post-it que dice «esto podría funcionar como un test de personalidad» y eso acaba siendo una landing page. Cada paso se apoya en los anteriores y toda la cadena queda a la vista, así que un mes después puedes ver no solo lo que hizo el equipo, sino cómo llegó ahí y qué descartó por el camino.
Y el tablero es compartido. Las cuarenta imágenes que no cuajaron siguen ahí para que el equipo las vea, atenuadas y apartadas en lugar de borradas. Eso es lo que hace defendible una decisión más adelante, cuando un cliente pregunte por qué la campaña se ve así y no como la opción obvia.
Los modelos de imagen van a seguir mejorando. Las imágenes que te entreguen serán cada vez mejores y seguirán siendo el promedio de lo que reciben todos los demás. Lo difícil seguirá siendo saber qué quieres, enseñarle al modelo algo real y elegir la imagen que es tuya.
FAQ
¿Por qué las imágenes generadas por IA se parecen todas? Porque todo el mundo describe lo que quiere con palabras parecidas, y los modelos devuelven el resultado más probable para esas palabras. Dylan Field, de Figma, dice que el primer resultado es genérico por definición. Darle al modelo tus propias referencias en lugar de adjetivos es lo que aleja el resultado del promedio.
¿Por qué cuesta usar Midjourney en equipo? Las generaciones viven en un hilo de chat personal. El output es lineal, así que las imágenes no se pueden comparar lado a lado y casi todo lo que una persona probó es invisible para el resto. Los intentos descartados y el razonamiento detrás de cada decisión desaparecen con el hilo.
¿Cómo se obtienen mejores resultados de una herramienta de imagen con IA? Deja de intentar escribir un prompt mejor. Dale al modelo material real: imágenes de referencia, activos de marca, investigación y las notas que explican la intención. Inputs específicos producen outputs específicos.
¿Dónde deberían guardar los equipos las imágenes generadas por IA? En un sitio donde todo el equipo pueda verlas juntas, junto al brief y a las referencias que las produjeron, incluidas las versiones descartadas. Una carpeta de descargas pierde todo ese contexto en una semana.
¿ALLO genera imágenes? Sí, sobre el lienzo. Seleccionas las referencias y notas con las que quieres que trabaje, generas, y el resultado aparece como un objeto sobre el tablero, junto a sus inputs, donde el equipo puede comparar, comentar y elegir.