Text-to-Image adalah kategori model AI generatif yang menghasilkan gambar baru berdasarkan deskripsi teks (prompt) yang diberikan pengguna, memungkinkan siapa saja menciptakan visual—mulai dari ilustrasi, foto realistis, hingga karya seni gaya tertentu—hanya dengan menuliskan apa yang ingin mereka lihat, tanpa perlu keahlian menggambar atau desain sama sekali.
Mayoritas model text-to-image modern dibangun di atas arsitektur diffusion model, yang bekerja dengan cara "membersihkan" gambar dari noise acak secara bertahap hingga membentuk gambar yang koheren dan sesuai dengan deskripsi teks yang diberikan. Proses ini dipandu oleh representasi embedding dari teks prompt, yang menjadi acuan bagi model untuk menentukan objek, gaya, komposisi, dan detail visual lain yang seharusnya muncul dalam gambar hasil.
Kualitas dan kegunaan model text-to-image umumnya dinilai dari beberapa aspek: kesetiaan terhadap prompt (seberapa akurat gambar mencerminkan deskripsi yang diberikan), kualitas visual dan detail, kemampuan menghasilkan teks yang terbaca dengan benar di dalam gambar (tantangan klasik yang lama menjadi kelemahan model generasi awal), serta fleksibilitas dalam meniru berbagai gaya seni dan fotografi. Fitur pelengkap seperti ControlNet juga memungkinkan pengguna memberi kontrol lebih presisi atas komposisi dan pose objek dalam gambar yang dihasilkan.
Text-to-image telah digunakan secara luas di berbagai industri kreatif: desain grafis, ilustrasi konsep, pembuatan aset visual untuk marketing dan media sosial, konsep art untuk game dan film, hingga prototyping desain produk. Di sisi lain, kemampuan ini juga memunculkan kekhawatiran seputar hak cipta karya seni yang digunakan sebagai data pelatihan, potensi penyalahgunaan untuk membuat konten menyesatkan, serta kebutuhan mekanisme content provenance seperti watermarking untuk menandai gambar yang dihasilkan AI.
