Midjourney Prompts Anleitung für Produktfotos 2026
Zusammenfassung
Midjourney verarbeitet Prompts wie ein Suchalgorithmus, nicht wie ein Mensch: Wortreihenfolge bestimmt das Gewicht, Lücken füllt das Modell mit statistischen Durchschnittswerten aus dem Trainingsset. Die vier Elemente Motiv, Stil, Licht und Format decken die meisten professionellen Anforderungen ab. --style raw ist für E-Commerce-Produktfotos unverzichtbar. Hände, Text auf Produkten und Mehrfach-Objekte liefern zuverlässig schlechte Ergebnisse - den Workflow entsprechend planen. Optimale Promptlänge: 20 bis 60 Wörter.
Diese Midjourney Prompts Anleitung beschreibt den Punkt, an dem man aufhört zu raten und anfängt zu steuern. Der Unterschied zwischen einem Prompt, der landet, und einem, der generische Ergebnisse liefert, liegt nicht in der Textlänge. Er liegt in der Reihenfolge der Informationen, in der Präzision der Lichtbeschreibung und in drei bis vier Parametern, die das Modell in die richtige Richtung zwingen. Wer mit v6.1 bereits erste Versuche gemacht hat und an austauschbaren Outputs hängt, findet hier die nächste Stufe.
Was Midjourney mit einem Prompt wirklich macht
Midjourney liest Prompts nicht so, wie ein Mensch einen Satz liest. Das Modell funktioniert wie ein visueller Autocompletion-Mechanismus, der auf Milliarden von Bildern trainiert wurde. Der Prompt wird verarbeitet wie Ankertext in einer Suchmaschine: Die ersten und semantisch stärksten Begriffe bekommen das meiste Gewicht. Bekannte Stile und Techniken werden extrapoliert. Lücken füllt das Modell mit statistischen Durchschnittswerten aus dem Trainingsset.
Die praktische Konsequenz ist direkt: Wortfolge hat messbaren Einfluss auf das Ergebnis. Ein Prompt, der mit "product photography, glass perfume bottle" beginnt, zieht das Modell in Richtung kommerzieller Fotokonventionen vom ersten Token an. Ein Prompt, der mit "a beautiful bottle" anfängt, öffnet das Modell für tausende von Variationen des Konzepts "schönes Objekt" - wovon kaum etwas aus dem kommerziellen Register stammt.
Das Modell extrahiert aus benannten Referenzstilen konkrete visuelle Eigenschaften. "Irving Penn" bedeutet für das Modell ein kohärentes Licht- und Kompositionssystem mit minimalistischem Hintergrund und spezifischer Schattentopographie. "Instagram aesthetic" bedeutet hundert Millionen Bilder ohne gemeinsames System. Die Referenz entscheidet, welcher Teil des Trainingssets aktiv wird.
Die optimale Promptlänge liegt zwischen 20 und 60 Wörtern. Über 60 Wörter verschlechtern sich die Ergebnisse, weil konkurrierende Signale sich gegenseitig schwächen und das Modell nicht mehr entscheiden kann, welches Signal mehr Gewicht bekommt. Mehr Text ist kein Ersatz für präzisere Begriffe an der richtigen Position. Diese Erkenntnis allein verändert, wie man Prompts schreibt.
Die vier Elemente eines Prompts, der landet
[Motiv] + [Stil oder Medium] + [Licht] + [Format]
Jedes Element hat einen konkreten Job. Die Reihenfolge ist nicht beliebig - sie folgt der Logik, wie das Modell Gewichtungen verteilt.
Das Motiv legt fest, was im Bild existiert und was das primäre visuelle Element ist. Hier so spezifisch wie möglich sein. "Ceramic mug with matte glaze, top-down view" führt zu anderen Ergebnissen als "a mug". Die Beschreibung des Motivs setzt die Erwartungshaltung des Modells für alle folgenden Elemente.
Der Stil weist das Modell auf eine Referenzmenge hin. "Product photography" aktiviert kommerzielle Fotokonventionen, die das Modell aus tausenden von E-Commerce-Bildern kennt. "Editorial fashion" aktiviert ein komplett anderes Set. Namentliche Referenzen schlagen generische Adjektive wie "professional" oder "high quality" - letztere sind Bewertungen, keine Beschreibungen, und das Modell kann mit Bewertungen wenig anfangen.
Das Licht ist das Element, das Anfänger am häufigsten überspringen, und es ist fast immer der wichtigste Hebel für die Ausgabequalität. "Softbox side lighting" beschreibt ein konkretes Studiosetup mit definierten Schatten. "Rim lighting plus chiaroscuro" platziert das Bild näher an Luxuswerbefotografie. "Window light, slightly overcast" liefert das flache, realistische Register von Etsy-Handmade-Aufnahmen. Jede dieser Beschreibungen aktiviert einen anderen Teil des Trainingssets.
Das Format sagt dem Modell, wofür das Bild verwendet wird: Seitenverhältnis, Ausrichtung, ob negativer Raum für Text-Overlays benötigt wird, ob das Bild für Print oder Digital ausgelegt sein soll.
Konkretes Beispiel: ceramic mug, studio product photography, softbox side lighting with rim light, clean white background, --ar 1:1 --v 6.1 --style raw
Dieser Prompt hat unter 30 Wörter und liefert ein verlässlich kommerzielles Ergebnis. 40 weitere Wörter verbessern es nicht. Ein widersprüchlicher Stilreferenz verschlechtert es messbar.
Diese Vier-Elemente-Struktur funktioniert besonders gut bei Tischgeschirr, Beauty-Produkten und kleinen Haushaltswaren, wo der Bildrahmen einfach und zentriert ist. Bei komplexen Props, mehreren Objekten oder Hintergrundszenen braucht die Struktur mehr Gerüst - dann wird die Motivbeschreibung erweitert, nicht durch Schichten weiterer Stilmodifikatoren, sondern durch konkreteres Beschreiben des Primärmotivs.

Produktfotos: Was konvertiert und was nur gut aussieht
Die Lücke zwischen einem schön aussehenden Bild und einem, das konvertiert, ist in der Praxis eine Licht- und Kompositionsentscheidung. Für E-Commerce-Produktfotografie sind es drei Prompt-Entscheidungen, die das Ergebnis systematisch bestimmen.
Die Oberfläche. "White background" aktiviert die häufigste E-Commerce-Konvention. Das ist in bestimmten Kontexten die richtige Wahl, aber nicht immer die stärkste. "Matte black surface, negative space for text overlay" aktiviert einen anderen kommerziellen Register: premium, markenstark, für Banner- und Social-Content-Einsatz gestaltet. Explizit sein ist Pflicht, nicht Option. Midjourney wählt ohne Angabe in etwa 40% der Fälle einen weißen Hintergrund. Wenn eine andere Oberfläche benötigt wird, muss sie benannt werden.
Der Licht-Deskriptor. Generische Adjektive wie "natural" oder "professional" liefern Median-Ausgaben - Bilder, die nicht falsch, aber auch nicht spezifisch genug für einen erkennbaren Brand-Look sind. Konkrete Setups liefern spezifische Ergebnisse. "Softbox side lighting" ist die Beschreibung eines realen Studioaufbaus, den das Modell aus hunderttausenden von Produktfotos kennt. "Rim lighting plus chiaroscuro" verweist auf Luxus- und Parfum-Werbefotografie. "Window light, slightly overcast" gibt das flache, natürliche Licht eines guten Tageslicht-Shooting-Tags.
Das Style-Flag. Standardmäßig fügt v6.1 eine künstlerische Verarbeitungsschicht hinzu, die Bilder gerendert statt fotografiert wirken lässt. Das Modell versucht, ansprechend zu sein, und interpretiert das als "ein bisschen malerischer". Für Produktaufnahmen, die als echte Fotografie durchgehen sollen, ist --style raw nicht optional. Ein Test lohnt sich: Dasselbe Bild einmal mit und einmal ohne --style raw generieren und vergleichen. Der Unterschied ist in den meisten Fällen entscheidend für die Nutzbarkeit im E-Commerce-Kontext.

Welche Parameter tatsächlich zählen - und drei, die man ignorieren kann
Vier Parameter decken 95% der professionellen Anwendungsfälle ab.
--ar (Seitenverhältnis): Immer setzen. Für Produktlistings: 1:1 für Etsy und Amazon. Für Social Content: 9:16 für TikTok und Reels, 3:2 für Print und Blog. Das Seitenverhältnis bestimmt die Komposition - ein Prompt ohne --ar überlässt diese Entscheidung dem Modell.
--style raw: Reduziert künstlerische Interpolation. Unverzichtbar für fotografienahe Ausgaben, bei denen das Bild als echte Aufnahme wirken soll. Ohne dieses Flag sehen auch technisch korrekte Prompts nach KI-generiertem Content aus.
--stylize (--s): Standard 100. Bereich 50-150 für Produktfotografie. Niedrigere Werte machen das Bild buchstäblicher und weniger interpretiert. Höhere Werte geben dem Modell mehr kreativen Spielraum. Für Produktfotos, die nah an der Wirklichkeit bleiben sollen, empfiehlt sich ein Wert zwischen 50 und 100.
--v 6.1: Aktueller Standard Mitte 2026. Immer explizit setzen, damit die Ergebnisse reproduzierbar bleiben, wenn eine neue Version als Standard eingeführt wird.
Parameter, die man ignorieren kann: --q (Qualitätsmultiplikator - kaum messbarer Effekt bei einfachen Prompts, erhöht nur Render-Zeit und Credits), --seed (nur relevant, wenn exakt dasselbe Bild reproduziert werden soll - für Produktion selten gebraucht), --chaos (erhöht die Varianz zwischen Outputs - nützlich für Exploration, nicht für Produktionspipelines). Diese drei kosten Zeit, ohne messbare Verbesserung für Standardaufgaben.
Welche Referenzstile in v6.1 wirklich greifen
Namentliche Fotograf- oder Publikationsreferenzen übertreffen vage Adjektive systematisch.
Für Studioprodukte: Irving Penn Produktarbeiten, Richard Avedon Parfum-Kampagnen. Beide repräsentieren klar definierte Licht- und Kompositionssysteme, auf denen das Modell trainiert wurde. Das Ergebnis ist konsistent und erkennbar, nicht generisch.
Für Lifestyle-Kontexte: Kinfolk-Magazin, Cereal-Magazin mit nordisch-minimalistischem Stil. Beide haben eine visuelle Identität, die das Modell mit großer Konsistenz extrapoliert: helle, neutrale Hintergründe, reduzierte Farbpaletten, natürliches Licht.
Was nicht funktioniert: "Instagram aesthetic" oder "Pinterest aesthetic" als primäre Referenz. Beide Begriffe sind zu weit gefasst, um dem Modell eine nützliche visuelle Richtung zu geben. Das Ergebnis ist visueller Durchschnitt aus einer zu breiten Trainingsbasis - erkennbar generisch, nicht erkennbar markenspezifisch. Die Bilder sehen aus wie KI-Bilder, nicht wie eine identifizierbare visuelle Sprache.
Die Logik dahinter: Konkrete Referenzen zeigen dem Modell, welcher Teil des Trainingssets gemeint ist. Vage Adjektive fragen das Modell, selbst zu entscheiden, was "gut" bedeutet. Das Modell liefert dann den Durchschnitt aus allem, was in seinem Trainingsset als "gut" gilt.
Wo Midjourney systematisch versagt - und was dann hilft
Drei Kategorien liefern zuverlässig schlechte Ergebnisse, unabhängig von der Promptqualität.
Anatomie bei gehaltenen Objekten. Hände und Handgelenke verformt Midjourney in den meisten Fällen. Das ist kein Fehler der Promptformulierung, sondern ein bekanntes Systemproblem. Lösung: Overhead-Flatlay oder reine Packshot-Rahmungen verwenden. Das Produkt steht für sich, keine Extremitäten im Bild. Das ist in den meisten E-Commerce-Kontexten ohnehin die sauberere Wahl.
Text auf Produkten. Halluziniert ausnahmslos. Midjourney erfindet Schrift, die visuell plausibel wirkt - das Label sieht aus, als wäre es lesbar, aber der Text ist erfunden oder verformt. Workflow: Produkt ohne Text generieren, das Label oder den Brand-Text separat in Post-Production einfügen. Kein Prompt löst dieses Problem - es ist eine architektonische Einschränkung des Bildgenerators, die durch bessere Promptformulierung nicht überwindbar ist.
Mehrere unterschiedliche Produkte in einem Frame. Einzeln generieren, das Finalbild zusammensetzen. Mehrere Objekte in einem Prompt erzeugen oft ein Mash-up: Proportionen stimmen nicht, Objekte überlagern sich falsch, die Komposition ist unkontrolliert. Für Produktfamilien, Flatlay-Arrangements oder Set-Shots ist die Composite-Pipeline der einzig verlässliche Weg.
Diese Einschränkungen sind keine Argumente gegen das Tool. Sie sind Gründe, den Workflow entsprechend zu strukturieren - und wer das tut, vermeidet den größten Teil der Frustration.

Midjourney in einen echten Creator-Workflow integrieren
Midjourney für Komposition und Atmosphäre, Post-Production für Präzision. Mit gut strukturierten Prompts liegt der Zeitaufwand bei 4-8 Minuten pro Bild, inklusive Variationen und Feinabstimmung. Der kreative Aufwand verschiebt sich von der Kamera zur Promptformulierung.
Für saisonales Batch-Arbeiten lohnt ein anderer Ansatz: photospells Style Alchemy und Season Swap laufen Transformationen auf echter Produktfotografie in großem Maßstab. Midjourney gibt die kreative Richtung vor und liefert Kompositionsideen. photospells übernimmt den Skalierungsschritt für definierte visuelle Styles auf realen Produktaufnahmen, ohne jeden Shot manuell prompten zu müssen.
Der praktische Split: Midjourney für Kreativkonzept, Kompositionsexploration und stilistische Richtungsfindung. photospells für Batch-Verarbeitung von Produktaufnahmen in kontrollierten Looks. Das sind keine konkurrierenden Ansätze - sie lösen unterschiedliche Probleme in unterschiedlichen Workflow-Phasen.
In der Praxis bedeutet das: Midjourney für die Frage "Wie soll dieses Produkt aussehen?" - photospells für die Frage "Wie verarbeite ich 200 Produktfotos in diesem Look an einem Arbeitstag?" Wer beides im richtigen Moment einsetzt, produziert konsequenter als mit einem einzigen Tool allein.