Guida ai prompt Midjourney: struttura, stili e parametri
Riassunto
Questa guida ai prompt Midjourney spiega la differenza tra una descrizione generica e un prompt che produce risultati commerciali. In circa 20-60 parole, un prompt ben strutturato segue quattro elementi: soggetto, stile, illuminazione e formato. Per la fotografia prodotto e-commerce, i parametri --ar, --style raw e --stylize fanno la differenza. La guida mostra anche dove il modello cede: mani, testi sui prodotti e scene composite.
C'è un momento preciso in ogni sessione Midjourney: smetti di descrivere e cominci a progettare. Questa guida ai prompt Midjourney copre esattamente quella transizione. La differenza tra una descrizione generica e una direttiva precisa, i quattro elementi strutturali che coprono la maggior parte dei casi d'uso professionali, e i parametri che contano davvero in v6.1. Se hai già lanciato qualche prompt e hai ottenuto risultati mediocri, è da qui che le cose cambiano.
Come Midjourney legge davvero il tuo prompt
Pensa a Midjourney come a un completamento visivo automatico addestrato su miliardi di immagini. Non legge il prompt come farebbe un essere umano, interpretando intenzione e contesto. Lo legge come un motore di ricerca legge il testo di un link: pesa i termini iniziali e più forti, interpola da stili e tecniche nominati, e colma le lacune con le medie statistiche dei suoi dati di addestramento.
La conseguenza pratica è diretta: l'ordine delle parole ha un effetto misurabile sull'output. Inizia con il soggetto e l'attributo visivo più importante. Un prompt che apre con "product photography, glass perfume bottle" orienta il modello verso le convenzioni della fotografia commerciale dal primo token. Partire invece con "a beautiful bottle" invita il modello a richiamare un'enorme varietà di immagini di "cosa bella", la maggior parte delle quali non ha nulla a che fare con ciò che cerchi.
Per questo motivo il consiglio più utile in qualsiasi guida ai prompt Midjourney riguarda la specificità, non la lunghezza. La lunghezza ottimale di un prompt è tra 20 e 60 parole. Oltre le 60 parole, i risultati tendono a peggiorare perché i segnali in conflitto si accumulano e il modello non riesce a ponderarli correttamente. È una soglia empirica documentata su test reali, non una regola arbitraria. Un prompt di 25 parole preciso supera quasi sempre un prompt di 80 parole ridondante.
La struttura in quattro parti che funziona sempre
[Soggetto] + [Stile o Medium] + [Illuminazione] + [Formato]
Ogni elemento ha un compito preciso. Il soggetto stabilisce il contenuto: cosa esiste nel frame e qual è l'elemento visivo principale. Lo stile orienta il modello verso un insieme di riferimenti: "product photography" attiva le convenzioni commerciali, "editorial fashion" ne attiva un insieme completamente diverso. L'illuminazione è spesso l'elemento che i principianti saltano, ed è quasi sempre la leva singola più potente sulla qualità dell'output finale. Il formato dice al modello come l'immagine verrà usata: rapporto d'aspetto, orientamento, se serve spazio negativo per testo in sovrimpressione.
Un esempio concreto: ceramic mug, studio product photography, softbox side lighting with rim light, clean white background, --ar 1:1 --v 6.1 --style raw
Quel prompt usa meno di 30 parole e produce un risultato commercialmente affidabile. Aggiungere 40 parole in più non lo migliora. Aggiungere un riferimento di stile in conflitto lo degrada in modo misurabile.
La struttura funziona meglio su stoviglie, prodotti beauty e piccoli oggetti per la casa dove il frame è semplice e centrato. Ha bisogno di più impalcatura quando si tratta di prop complessi, oggetti multipli o scene di sfondo che richiedono dettaglio contestuale. In quei casi, la soluzione è estendere la descrizione del soggetto, non sovrapporre ulteriori modificatori di stile. Ogni modificatore aggiuntivo riduce il peso relativo di quelli già presenti: è un gioco a somma fissa.

Prompt per la fotografia prodotto: cosa converte e cosa piace soltanto
Il divario tra un'immagine che piace e una che converte è, in pratica, una decisione di illuminazione e composizione. Per la fotografia prodotto e-commerce, tre scelte di prompt determinano costantemente il risultato finale.
Prima scelta: la superficie. "White background" attiva la convenzione e-commerce più comune. "Matte black surface, negative space for text overlay" attiva un registro commerciale diverso: premium, orientato al brand, progettato per l'uso nei banner. Essere espliciti qui non è opzionale. Midjourney torna a sfondo bianco circa il 40% delle volte quando non viene specificata alcuna superficie nel prompt.
Seconda scelta: il descrittore di illuminazione. Aggettivi generici come "natural" o "professional" producono output mediani perché corrispondono a troppi riferimenti diversi nel training set. I setup nominati producono risultati specifici e controllabili: "softbox side lighting" dà la fotografia commerciale diffusa e uniforme. "Rim lighting plus chiaroscuro" dà qualcosa di più vicino alla pubblicità di profumeria fine. "Window light, slightly overcast" dà il registro piatto ma realistico del prodotto artigianale, il tono tipico dei catalog Etsy handmade.
Terza scelta: se specificare --style raw. Per impostazione predefinita, v6.1 aggiunge uno strato di elaborazione artistica che rende le immagini percepibilmente "renderizzate", non fotografate. Per le foto prodotto destinate a passare per fotografia reale, --style raw non è opzionale: è la differenza tra un output che funziona e uno che tradisce immediatamente il processo di generazione.

I parametri che contano davvero (e tre da ignorare)
--ar (aspect ratio): Impostalo sempre. Per i listing prodotto: 1:1 per Etsy e Amazon. Per i contenuti social: 9:16 per TikTok e Reels, 3:2 per stampa e blog. Lasciarlo non specificato consegna al modello una decisione che dovresti prendere tu.
--style raw: Riduce l'interpolazione artistica. Essenziale per output adiacenti alla fotografia reale. Senza, v6.1 aggiunge una patina che non passa il test della naturalezza su un listing e-commerce.
--stylize (--s): Default 100. Intervallo 50-150 per la fotografia prodotto. Valori più bassi producono output più neutri e fotografici; valori più alti aggiungono interpretazione stilistica che in certi casi funziona per contenuti editoriali, ma spesso introduce elementi incoerenti con i catalog e-commerce standard.
--v 6.1: Default corrente a metà 2026. Non specificarlo porta a usare la versione di default, che al momento coincide, ma dichiararlo esplicitamente garantisce riproducibilità dei risultati nel tempo.
Tre parametri da ignorare nella maggior parte dei casi: --q (la qualità di default è già adeguata per uso web e social), --seed (utile solo se hai bisogno di riproducibilità controllata per varianti dello stesso prodotto), --chaos (introduce variazione casuale non utile nel lavoro commerciale dove la coerenza è la priorità).
Stili di riferimento efficaci in v6.1 e una categoria da evitare
I riferimenti a fotografi specifici o pubblicazioni note funzionano molto meglio degli aggettivi vaghi. Il motivo è tecnico: un riferimento preciso orienta il modello su convenzioni documentate nel training set, temperatura colore specifica, rapporto luce-ombra riconoscibile, gestione del bokeh, composizione tipica di quel fotografo o di quella pubblicazione.
Per la fotografia prodotto in studio: Irving Penn product work, campagne fragranze di Richard Avedon. Per il lifestyle minimale: Kinfolk magazine, minimalismo nordico di Cereal magazine. Questi riferimenti producono direzioni stilistiche coerenti e riproducibili, non output casuali.
Da evitare come riferimento primario: "Instagram aesthetic" o "Pinterest aesthetic". Il loro training set è troppo ampio per avere un effetto preciso. Producono output mediani, difficilmente distinguibili dall'output di default, e mancano di identità visiva specifica. Un aggettivo vago chiede al modello di scegliere tra milioni di varianti; un riferimento preciso riduce quello spazio a una famiglia stilistica riconoscibile e controllabile. La differenza nell'output finale è immediata e misurabile.
Dove i prompt Midjourney cedono e cosa fare invece
Tre limiti strutturali emergono regolarmente nel lavoro commerciale. Conoscerli in anticipo evita ore di iterazioni inutili e aspettative mal calibrate.
Anatomia con oggetti tenuti in mano. Le mani sono il punto più documentato di cedimento del modello. Dita aggiuntive, proporzioni errate, giunture anatomicamente impossibili: la letteratura su questo problema è ampia. La soluzione non è descrivere le mani con più precisione nel prompt; è cambiare il tipo di frame. Le inquadrature overhead flatlay o packshot eliminano il problema alla radice senza richiedere correzioni in post-produzione.
Testi sui prodotti. Il modello allucinato sistematicamente scritte, etichette e testi leggibili, indipendentemente da quanto sia preciso il prompt. Non esiste una formulazione che risolva questo in v6.1. Il workflow corretto per la fotografia prodotto è generare senza testo e poi comporre l'etichetta separatamente in post-produzione, dove controllo e precisione sono totali.
Prodotti multipli distinti. Quando il frame deve contenere due o più oggetti differenti e non correlati, il modello non mantiene in modo affidabile proporzioni e relazioni spaziali tra di loro. Il risultato tipico è una fusione o una distorsione di scala. La soluzione è generare ogni prodotto separatamente e comporre l'immagine finale in post.

Come integrare l'output di Midjourney in un workflow di produzione reale
Midjourney per la composizione e l'atmosfera; la post-produzione per la precisione. Con prompt ben strutturati, il ciclo si stabilizza intorno ai 4-8 minuti per immagine, includendo le iterazioni necessarie per arrivare a un output utilizzabile.
Per il lavoro batch stagionale, i sort di photospells come Style Alchemy e Season Swap eseguono trasformazioni su scala su foto prodotto reali: stessa coerenza visiva, tempi molto più prevedibili rispetto alla generazione da zero. Midjourney stabilisce la direzione creativa; photospells gestisce la scala. Non sono approcci in concorrenza tra loro: occupano fasi diverse dello stesso workflow produttivo.
La domanda utile non è "uso Midjourney o no?". È "quale parte del processo delego al modello e quale gestisco direttamente?". La risposta dipende dal volume di output richiesto e dal grado di coerenza visiva che il progetto impone. Per i creator che lavorano su cataloghi stagionali con decine di varianti, l'automazione batch è ciò che cambia i tempi di produzione, non il prompt singolo ottimizzato. In pratica, ci vogliono circa 4-8 minuti per immagine con un prompt ben strutturato: un tempo che scala linearmente, non esponenzialmente, man mano che il volume cresce.