Back to top
  • 공유 Paylaş
  • 인쇄 Yazdır
  • 글자크기 Yazı tipi Boyutu
URL kopyalandı.

4K çözünürlüğe yükseltme yapan Gemini Omni 1.1 Flash tanıtıldı

Tablette açık video düzenleme ekranı / TokenPost.ai

Google(GOOGL), video üretebilen yapay zeka modeli 'Gemini Omni 1.1 Flash'ı duyurdu ve modele en fazla '4K' çözünürlüğe yükseltme, sahne uzatma ile ilk kare-son kare belirleme özelliklerini ekledi. Metin ve görsel ağırlıklı üretken yapay zeka üretim süreci, böylece video düzenleme ve tekrarlı üretim alanına doğru genişliyor.

Google, 27'sinde (yerel saatle) resmi blogunda Gemini Omni 1.1 Flash'ın Google AI Studio'daki Gemini API'sinde ve Gemini Enterprise ajan platformunda kullanılabildiğini açıkladı. Şirket, Google Flow'da özelliğin Google AI Plus, Pro ve Ultra abonelerine dünya genelinde sunulmaya başlandığını, Gemini uygulamasında ise sahne uzatma özelliğinin devreye girdiğini belirtti.

Yeni model; metin, görsel ve video girdisi alarak yeni video üretmeye ya da mevcut videoyu düzenlemeye odaklanıyor. Google'ın geliştirici dokümantasyonuna göre modelin kodu 'gemini-omni-1.1-flash' ve girdi olarak metin, görsel ve video destekleniyor.

Düzenleme ve uzatma için yüklenen videolar en fazla 10 saniye olabiliyor. Çıktı videolar ise 3 ila 10 saniye uzunluğunda üretiliyor. Bu yapı, kısa videoları art arda ekleyerek sahne akışını ayarlayan bir üretim biçimine göre kurgulanmış.

Modelin öne çıkan değişikliği, üreticilere sahne üzerinde daha doğrudan kontrol vermesi. Kullanıcılar mevcut videonun ardına yeni bir sahne ekleyebiliyor; model de önceki en fazla 10 saniyelik bölümü referans alarak hareketi, karakterleri ve sahne akışını sürdürüyor. Google resmi blogunda videoların 10 saniyelik dilimler halinde uzatılabildiğini ve toplamda en fazla '40 saniyeye' kadar genişletilebildiğini duyurdu.

'İlk kare' ve 'son kare' belirleme özelliği de eklendi. Başlangıç ve bitiş görseli girildiğinde model, iki sahneyi tek bir kesintisiz videoya bağlıyor. Özellik; kamera hareketi, yakınlaştırma geçişleri ve döngüsel videolar gibi sahneler arası bağlantının önemli olduğu işler için tasarlandı.

Referans video girdisi özelliği, karakter hareketini ya da görsel bağlamı korumak isteyen üretimlerde kullanılıyor. Kullanıcılar en fazla 3 saniyelik bir referans video yükleyerek yeni video üretebiliyor. Bu yöntem, tek bir durağan görselle aktarılması zor olan hareket bilgisini ve sahne atmosferini modele birlikte sunuyor.

Desteklenen çözünürlükler 360p, 720p, 1080p ve '4K'. Google'ın video dokümantasyonuna göre varsayılan çözünürlük 720p; 1080p ve 4K ise yükseltme (upscale) yöntemiyle elde ediliyor. '4K' çıktı öne çıkarılsa da, gerçek üretim akışı düşük çözünürlüklü taslak ile yüksek çözünürlüklü son işlem aşamasını ayırmaya göre kurgulanmış.

Google, 360p taslak üretiminin sistem işlem hacmi bazında 720p'ye kıyasla en fazla yüzde 60 daha hızlı olduğunu, maliyetin ise üçte bir düzeyinde kaldığını açıkladı. Üreticiler düşük çözünürlükte birden fazla taslağı denedikten sonra yalnızca istenen sonucu yüksek çözünürlükte yeniden üretebiliyor. "Video üretiminde yapay zeka rekabetinin artık yalnızca kalite değil, tekrarlı üretim maliyeti üzerinden de şekillendiği söylenebilir" yorumu bu noktada öne çıkıyor.

Ücretlendirme, ücretli API üzerinden belirlendi. Google'ın fiyatlandırma dokümanına göre video çıktı ücreti 1 milyon token başına 17,50 dolar; 720p video saniyede 5.792 token olarak hesaplandığından saniye başına yaklaşık 0,10 dolara denk geliyor.

Kore merkezli teknoloji medyası Digital Today, çözünürlüğe göre API ücretlerini 360p için saniyede 0,03 dolar, 720p için 0,10 dolar, 1080p için 0,15 dolar ve 4K için 0,30 dolar olarak aktardı. Bugünkü kur olan 1 dolar 1.382 Güney Kore wonu üzerinden hesaplandığında bu tutarlar sırasıyla yaklaşık 41, 138, 207 ve 415 won'a denk geliyor.

Video üretim modellerinde aynı istemin (prompt) birden çok kez denenip sonuçlar arasından seçim yapılması sık görülen bir çalışma biçimi. Bu nedenle nihai ürünün çözünürlüğü kadar taslak üretim birim maliyeti ve tekrar hızı da önem taşıyor. "360p taslak üretimi ile '4K' yükseltmenin birlikte öne çıkarılması, üretim maliyeti ile kalite arasındaki ayar aralığını genişletme girişimi olarak yorumlanabilir."

Bu çıkış, Google'ın üretken yapay zeka ürün ailesinin metin ve görsel ağırlıklı yapıdan video üretim sürecine doğru genişlemesiyle örtüşüyor. Yayınımız daha önce, Google'ın Gemini ve Flow'da yapay zeka üretimlerinde görünür su damgasını kapatma ayarını kullanıma açtığını aktarmıştı. Ancak söz konusu haberde Kore'de yerleşik kullanıcılar için görünür su damgasının otomatik uygulandığı belirtilmişti; bu nedenle bir kullanıcının bu özelliğe gerçekte ne ölçüde erişebileceği hesap bölgesine ve ürün ayarlarına göre değişebilir.

Üreticiler ve geliştiriciler için asıl belirleyici nokta, özelliklerin sunum kapsamı ile ücretlendirme biçimi. Google Flow ve Gemini API'nin Kore hesaplarına sunum kapsamı, çözünürlüğe göre ücretlendirme ve su damgası politikası, gerçek üretim ortamında tercih kriteri olabilir.

<Telif hakkı ⓒ TokenPost, yetkisiz çoğaltma ve yeniden dağıtım yasaktır >

Popüler

Diğer ilgili makaleler

Yorum 0

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.

0/1000

Yorum ipuçları

Harika bir makale. Takip talep etme. Mükemmel bir analiz.
1