Panduan Prompt Midjourney: Dari Deskripsi ke Hasil
Summary
Panduan prompt Midjourney ini mencakup empat elemen struktural utama, parameter penting v6.1, dan kasus kegagalan yang sering muncul dalam penggunaan komersial. Panjang prompt optimal antara 20 hingga 60 kata. Urutan kata berdampak nyata pada output. Untuk foto produk yang mengonversi, tiga keputusan prompt menentukan segalanya: pilihan permukaan, deskriptor pencahayaan spesifik, dan penggunaan --style raw.
Panduan prompt Midjourney ini membahas transisi penting: dari sekadar mendeskripsikan apa yang kamu bayangkan, ke memberikan arahan yang benar-benar dipahami model. Versi v6.1 sudah cukup canggih untuk menghasilkan foto produk berkualitas komersial, tapi hasilnya sangat bergantung pada cara kamu menyusun prompt. Artikel ini mencakup empat elemen struktural utama, parameter yang perlu dipahami dalam v6.1, dan kasus di mana Midjourney justru akan mengecewakan.
Cara Midjourney Membaca Prompt dan Kenapa Urutan Kata Penting
Bayangkan Midjourney sebagai autocomplete visual yang dilatih pada miliaran gambar. Model ini tidak membaca prompt seperti manusia membaca kalimat, dengan memahami niat dan konteks. Ia membaca lebih seperti mesin pencari membaca anchor text: memberikan bobot pada kata-kata pertama dan terkuat, mengekstrapolasi dari nama gaya dan teknik yang disebutkan, lalu mengisi celah dengan rata-rata statistik dari data pelatihannya.
Konsekuensi praktisnya langsung terasa. Urutan kata memiliki efek yang terukur pada output. Prompt yang dibuka dengan "product photography, glass perfume bottle" akan membiaskan model ke arah konvensi foto komersial sejak token pertama. Membuka dengan "a beautiful bottle" mengundang model untuk mencocokkan pola dari ribuan gambar "benda indah" yang berbeda-beda, sebagian besar tidak ada hubungannya dengan yang kamu inginkan.
Ini sebabnya saran paling konsisten berguna dalam panduan prompt Midjourney mana pun adalah tentang spesifisitas, bukan panjang. Panjang prompt optimal berada di antara 20 hingga 60 kata. Di atas 60 kata, hasil cenderung memburuk karena sinyal yang saling bertentangan mulai menumpuk dan model kehilangan arah.
Satu lagi yang sering diabaikan: kata sifat generik seperti "beautiful", "stunning", atau "amazing" hampir tidak berdampak pada output. Model sudah terlatih pada gambar yang secara default dianggap menarik. Yang menggerakkan output adalah kata-kata teknis: nama teknik pencahayaan, referensi fotografer, nama medium, spesifikasi format.
Empat Bagian Struktur yang Ada di Balik Setiap Prompt yang Berhasil
Struktur empat bagian ini berlaku untuk sebagian besar kasus penggunaan profesional:
[Subjek] + [Gaya atau Medium] + [Pencahayaan] + [Format]
Setiap elemen memiliki peran spesifik dan tidak bisa digantikan oleh yang lain.
Subjek menentukan konten: apa yang ada dalam frame dan apa elemen visual utamanya. Semakin spesifik deskripsi subjek, semakin sedikit model perlu menebak. "Ceramic mug" lebih baik dari "mug". "Matte black ceramic mug with gold handle" lebih baik lagi, asalkan tidak melampaui batas 60 kata secara keseluruhan.
Gaya mengarahkan model ke set referensi tertentu: "product photography" mengaktifkan konvensi komersial, "editorial fashion" mengaktifkan set yang sama sekali berbeda. Kata "photography" dalam deskriptor gaya secara signifikan menggeser output ke arah realisme foto dibanding rendering artistik.
Pencahayaan adalah elemen yang paling sering dilewati pemula, dan hampir selalu menjadi faktor tunggal terbesar yang memengaruhi kualitas output. Model memiliki pemahaman yang sangat spesifik tentang setup pencahayaan yang disebutkan namanya. "Softbox side lighting" menghasilkan hasil yang berbeda secara dramatis dari "window light" atau "ring light", masing-masing dengan karakteristik bayangan dan highlight yang khas.
Format memberi tahu model bagaimana gambar akan digunakan: rasio aspek, orientasi, apakah diperlukan ruang negatif untuk teks overlay.
Contoh konkret yang bekerja konsisten:
ceramic mug, studio product photography, softbox side lighting with rim light, clean white background, --ar 1:1 --v 6.1 --style raw
Prompt itu kurang dari 30 kata dan menghasilkan hasil komersial yang dapat diandalkan. Menambah 40 kata lagi tidak meningkatkannya. Menambahkan referensi gaya yang saling bertentangan justru akan merusaknya.
Struktur empat bagian paling cocok untuk peralatan meja makan, produk kecantikan, dan perabot rumah tangga kecil di mana frame sederhana dan terpusat. Ketika menangani props yang kompleks, beberapa objek, atau latar belakang yang memerlukan detail kontekstual, perluas deskripsi subjek daripada menumpuk modifier gaya tambahan.

Prompt Foto Produk: Yang Mengonversi vs. Yang Sekadar Terlihat Bagus
Jarak antara gambar yang terlihat bagus dan gambar yang mengonversi pada dasarnya adalah keputusan pencahayaan dan komposisi. Untuk foto produk e-commerce, tiga pilihan prompt secara konsisten menentukan hasilnya.
Pertama: permukaan. "White background" mengaktifkan konvensi e-commerce yang paling umum, latar yang tepat untuk listing Etsy dan Amazon. "Matte black surface, negative space for text overlay" mengaktifkan register komersial yang berbeda: premium, berfokus merek, dirancang untuk penggunaan banner atau kampanye iklan. Midjourney secara default ke background putih sekitar 40% waktu ketika tidak ada permukaan yang ditentukan. Jika kamu tidak menyebutkannya, model akan memilih sendiri, dan pilihannya mungkin tidak sesuai dengan kebutuhanmu.
Kedua: deskriptor pencahayaan. Kata sifat generik seperti "natural" atau "professional" menghasilkan output median, gambar yang tidak buruk tapi tidak menonjol. Setup yang disebutkan namanya menghasilkan hasil spesifik: "softbox side lighting" memberikan foto komersial yang menyebar dengan bayangan lembut. "Rim lighting plus chiaroscuro" memberikan sesuatu yang lebih dekat dengan iklan parfum mewah. "Window light, slightly overcast" memberikan register produk buatan tangan yang datar namun terasa autentik, cocok untuk Etsy seller yang ingin tampilan handmade.
Ketiga: --style raw. Secara default, v6.1 menambahkan lapisan pemrosesan artistik yang membuat gambar terlihat dirender, bukan difoto. Tekstur terlihat terlalu halus, bayangan terlalu sempurna, keseluruhan gambar memiliki kualitas yang langsung terbaca sebagai "gambar AI". Untuk foto produk yang dimaksudkan agar terlihat seperti foto nyata untuk keperluan listing atau iklan, --style raw tidak bisa ditawar.
Satu hal yang perlu dicatat: kombinasi --style raw dengan referensi pencahayaan yang sangat spesifik terkadang menghasilkan output yang terlalu literal, kehilangan atmosfer yang membuat gambar menarik secara visual. Jika hasil terasa terlalu steril, coba naikkan --stylize ke 120-150 sambil tetap mempertahankan --style raw.

Parameter yang Perlu Diatur, dan Tiga yang Bisa Diabaikan
Dokumentasi Midjourney mencantumkan lebih dari dua puluh parameter. Sebagian besar tidak relevan untuk penggunaan foto produk komersial. Berikut yang benar-benar perlu diperhatikan:
--ar (rasio aspek): Selalu atur ini. Untuk listing produk: 1:1 untuk Etsy dan Amazon. Untuk konten sosial: 9:16 untuk TikTok dan Reels, 3:2 untuk cetak dan blog. Membiarkan model memilih rasio aspek sendiri hampir selalu menghasilkan frame yang tidak sesuai dengan platform tujuan.
--style raw: Mengurangi interpolasi artistik. Esensial untuk output yang menyerupai foto yang dimaksudkan sebagai aset komersial. Untuk output yang sengaja artistik, abaikan parameter ini.
--stylize (--s): Default 100. Untuk foto produk, rentang 50-150 memberikan keseimbangan yang baik antara mengikuti prompt dan menambahkan variasi visual. Di bawah 50, output menjadi sangat literal dan sering kehilangan kualitas teknis. Di atas 150, model mulai bereksperimen terlalu jauh dari prompt asli.
--v 6.1: Default saat ini per pertengahan 2026. Tidak perlu diatur secara eksplisit kecuali kamu perlu kompatibilitas dengan versi lama untuk konsistensi batch.
Parameter yang bisa diabaikan untuk sebagian besar kasus:
--q tidak lagi relevan di v6.1 karena kualitas render sudah dioptimalkan secara default. Mengaturnya tidak memberikan perbedaan yang terlihat pada resolusi standar.
--seed berguna hanya jika kamu perlu mereproduksi hasil yang persis sama, misalnya untuk variasi warna produk yang harus mempertahankan komposisi identik. Untuk eksplorasi kreatif biasa, tidak perlu.
--chaos menghasilkan variasi yang tidak dapat diprediksi. Ini bisa berguna untuk brainstorming awal, tapi kontraproduktif untuk workflow produksi di mana konsistensi adalah prioritas.
Gaya Referensi yang Bekerja di v6.1, dan Satu Kategori yang Harus Dihindari
Referensi yang disebutkan namanya selalu lebih efektif dari kata sifat yang kabur. Model memiliki pemahaman yang kaya tentang fotografer dan publikasi tertentu, dan referensi tersebut mengaktifkan set konvensi visual yang jauh lebih spesifik dari "professional" atau "high-quality".
Untuk foto produk studio: karya Irving Penn pada produk dan still life mengaktifkan estetika komersial bersih dengan pencahayaan yang sangat terkontrol. Kampanye parfum Richard Avedon memberikan kualitas fine fragrance advertising: kontras tinggi, dramatis, dengan subjek yang terisolasi secara visual.
Untuk gaya lifestyle dan editorial: Kinfolk magazine mengaktifkan minimalis warm Nordic, tekstur natural, dan suasana slow-living yang cocok untuk produk artisanal. Cereal magazine mendorong lebih jauh ke estetika minimalis dingin yang bekerja baik untuk produk desain kontemporer.
Satu kategori yang harus dihindari sebagai referensi utama: "Instagram aesthetic" atau "Pinterest aesthetic". Referensi ini terlalu luas dan mendorong model ke output yang diproses secara berlebihan secara statistik. Hasilnya akan terasa generik justru karena referensinya terlalu populer, model mengambil rata-rata dari jutaan gambar yang semuanya mengklaim estetika tersebut.
Di Mana Prompt Midjourney Gagal dan Apa yang Harus Dilakukan
Ada tiga kategori kegagalan yang muncul berulang kali dalam penggunaan komersial, dan masing-masing memiliki solusi kerja yang berbeda.
Anatomi dengan objek yang dipegang: Model masih sering menghasilkan tangan yang salah secara anatomis, terutama ketika tangan memegang produk berukuran tidak biasa atau dalam posisi yang tidak umum dalam data pelatihan. Solusinya bukan mencoba memperbaiki prompt, tapi menghindari framing ini sepenuhnya. Gunakan overhead flatlay atau packshot yang tidak menampilkan tangan, lalu komposit elemen manusia secara terpisah di tahap pasca produksi jika diperlukan.
Teks pada produk: Midjourney tidak dapat merender teks yang dapat dibaca secara andal pada label, kemasan, atau produk apa pun. Karakter yang dihasilkan hampir selalu merupakan kombinasi acak yang terlihat seperti tulisan tapi tidak bisa dibaca. Pendekatan yang bekerja: buat gambar produk tanpa teks sama sekali, lalu komposit label atau branding secara terpisah menggunakan alat desain seperti Photoshop atau Figma. Ini bukan workaround, ini workflow yang lebih bersih karena kamu mempertahankan kontrol penuh atas tipografi.
Beberapa produk berbeda dalam satu frame: Mencoba menempatkan tiga produk berbeda dalam satu prompt hampir selalu menghasilkan pencampuran visual di mana karakteristik satu produk bocor ke produk lain, atau proporsi yang tidak konsisten antar objek. Buat setiap produk secara terpisah, lalu komposit gambar akhir. Ini juga memberikan fleksibilitas lebih besar untuk mengatur komposisi akhir.

Mengintegrasikan Output Midjourney ke dalam Workflow Kreator yang Nyata
Midjourney paling efektif sebagai alat untuk komposisi dan atmosfer. Pasca produksi menangani presisi: warna yang tepat, teks yang dapat dibaca, konsistensi merek di seluruh batch. Dengan prompt yang terstruktur baik, setiap gambar membutuhkan sekitar 4-8 menit dari prompt hingga aset yang siap pakai, termasuk beberapa iterasi untuk mencapai hasil yang tepat.
Untuk pekerjaan batch musiman atau konversi skala besar pada foto produk nyata, sorts photospells seperti Style Alchemy dan Season Swap menjalankan transformasi pada foto yang sudah ada. Midjourney menetapkan arahan kreatif dan menghasilkan konsep; photospells menangani skala transformasi pada aset foto yang sudah ada. Keduanya bukan pendekatan yang bersaing, mereka berada di tahap workflow yang berbeda.
Yang tidak berubah di seluruh tools dan pendekatan: keputusan tentang pencahayaan, permukaan, dan komposisi selalu datang pertama. Tidak ada model yang bisa mengompensasi brief visual yang lemah, apakah itu prompt v6.1 atau instruksi untuk sorts otomatis. Waktu yang diinvestasikan dalam mendefinisikan estetika yang tepat di awal selalu menghasilkan lebih sedikit iterasi dan lebih banyak aset yang dapat digunakan.