Image-to-Video adalah kategori model AI generatif yang mengubah satu gambar diam (statis) menjadi video pendek dengan gerakan yang koheren dan realistis, memperluas gambar tersebut menjadi rangkaian frame yang mensimulasikan pergerakan objek, kamera, atau elemen dalam gambar seolah-olah gambar tersebut "hidup".
Pendekatan ini sering digunakan sebagai kelanjutan alur kerja dari text-to-image: pengguna terlebih dahulu menghasilkan gambar diam dengan komposisi dan detail visual yang diinginkan, kemudian mengonversinya menjadi video menggunakan model image-to-video, sehingga memberi kontrol lebih presisi atas hasil akhir dibanding langsung menghasilkan video dari teks (text-to-video) yang cenderung lebih sulit dikendalikan komposisinya.
Secara teknis, model image-to-video umumnya juga berbasis arsitektur diffusion yang diperluas untuk menangani dimensi waktu, mempelajari bagaimana suatu adegan realistis biasanya bergerak dari waktu ke waktu berdasarkan data video pelatihan dalam skala besar. Tantangan utama dalam pengembangan model ini meliputi menjaga konsistensi objek dan latar belakang antar-frame (agar tidak terjadi distorsi atau perubahan bentuk yang tidak wajar), serta menghasilkan gerakan yang secara fisik masuk akal.
Kemampuan image-to-video banyak dimanfaatkan dalam produksi konten pemasaran, animasi pendek untuk media sosial, storyboard visual untuk produksi film dan iklan, hingga menghidupkan foto produk e-commerce menjadi tampilan yang lebih dinamis. Model-model terbaru di kategori ini terus berlomba meningkatkan durasi video yang dapat dihasilkan, resolusi, serta kemampuan mengikuti instruksi tambahan seperti arah gerakan kamera atau jenis gerakan spesifik yang diinginkan pengguna.
