Gemini Robotics 2.0: Google'ın Robotları Artık Hata Yapınca Durup Düşünüyor
Google DeepMind, Gemini Robotics 2.0 ile robotlara canlı video anlayışı, iş birliği yeteneği ve yeni bir güvenlik testi getirdi. İşte 'fiziksel AGI' hayaline bir adım daha.
Bir robotun kahve bardağını doldururken ne zaman durması gerektiğini bilmesi kulağa basit geliyor ama aslında bu, yapay zekanın fiziksel dünyayı 'anlaması' demek. Google DeepMind'ın bugün duyurduğu Gemini Robotics 2, tam olarak bunu vaat ediyor: robotların sadece talimat almasını değil, o talimatı hayata geçirirken çevresini gerçek zamanlı izleyip kendini düzeltmesini.
Bu, tek bir modelden ibaret değil. Google üç ayrı yapay zeka bileşeninden oluşan bir aile yayınladı. İlki, geliştiricilere şu andan itibaren açık olan Gemini Robotics ER 2 — 'gömülü akıl yürütme' (embodied reasoning) modeli. Bu bir görsel-dil modeli (VLM); robotun kameralarından gelen canlı görüntüyü işleyip görevin hangi adımda olduğunu anlıyor. Google'a göre ER 2, bir video karesinin görevin 'tamamlandığı' anı mı gösterdiğini yaklaşık %60 doğrulukla sınıflandırabiliyor — mütevazı bir rakam ama önceki 1.6 sürümüne göre büyük sıçrama. Görevdeki kritik anları (örneğin bardağın taştığı saniyeyi) tespit etme başarısı ise %90'a yaklaşıyor.
İkinci parça, doğrudan hareketi üreten Gemini Robotics 2 modeli; robotun eklemlerine, parmaklarına ne yapması gerektiğini söylüyor. Üçüncüsü ise düşük gecikmeli, çevrimdışı çalışabilen Gemini Robotics On-Device 2. Bu ikisi şimdilik sadece küçük bir test grubuna açık. Google, sistemi Apptronik'in Apollo 2'si, daha sade Franka F3 Duo kolları ve Boston Dynamics donanımı üzerinde deniyor; hatta demo videolarında iki farklı robotun birbirine çarpmadan aynı görevde çalıştığı görülüyor.
Bu Ne Anlama Geliyor?
Önceki robot videoları — dans eden, geriye takla atan makineler — genelde tek bir görev için özel olarak programlanmıştı. Gemini Robotics'in hedefi farklı: DeepMind bilim insanlarının 'fiziksel AGI' dediği, yani insan gibi genel amaçlı hareket edebilen bir robot beyni yaratmak. ER 2'nin bir görevin adımını canlı takip edip hata anında baştan başlamak yerine sadece o adımı tekrarlaması, bu hedefe giden yolda küçük ama kritik bir adım. Top yuvarlandığında elini yeniden konumlandırabilen bir robot, aslında 'anlık düşünme' yeteneği kazanmış oluyor — bu da daha önce ele aldığımız DeepMind ekibindeki değişimlerin neden bu kadar stratejik olduğunu bir kez daha gösteriyor.
Güvenlik cephesinde de somut bir adım var: ASIMOV-Agentic adlı yeni bir test seti, bir robotun güvensiz bir komutu reddedip reddetmediğini, görevi güvenli şekilde tamamlayıp tamamlayamayacağını ve şüphe anında insana danışıp danışmadığını ölçüyor. Bu test Hugging Face üzerinden herkese açık — yani başka geliştiriciler de kendi modellerini aynı ölçekle sınayabilecek. DeepMind, ER 2'nin insan robota yaklaştığında durma konusunda şirketin şimdiye kadarki en güvenli modeli olduğunu söylüyor.
5 yıl sonra bu teknolojinin nereye evrileceğini düşününce ortaya çıkan tablo heyecan verici: bugün %60 doğrulukla 'bu görev bitti mi' sorusuna cevap veren bir sistem, birkaç güncelleme sonra fabrika hattında insan gözetimine ihtiyaç duymadan çalışabilir. Yüzlerce hareket örneğiyle yeni bir robot tasarımına uyum sağlayabilen On-Device modelin bugünkü hali, yarının küçük atölyelerinde 'kendi robotunu birkaç saatte eğit' anlayışına dönüşebilir. Bu, robotları sadece büyük şirketlerin değil, orta ölçekli üreticilerin de erişebileceği bir araca dönüştürme potansiyeli taşıyor.
Türkiye'ye Etkisi
Türkiye'deki otomotiv ve beyaz eşya üreticileri için bu tür genel amaçlı robot beyinleri, özel donanım tasarlamadan mevcut kol robotlarını yeni görevlere uyarlama imkânı sunabilir. Şimdilik geliştirici erişimi sınırlı olsa da, ER 2'nin Gemini Live API üzerinden test edilebilmesi, Türk yazılım ekiplerinin de bu teknolojiyi erkenden denemesinin önünü açıyor.
Sık Sorulan Sorular
- Gemini Robotics 2.0 nedir?
- Google DeepMind'ın geliştirdiği, robotların çevresini canlı olarak anlamasını, görevleri adım adım takip etmesini ve hatalarını yeniden başa dönmeden düzeltmesini sağlayan üç parçalı yapay zeka model ailesidir.
- Gemini Robotics 2.0 herkese açık mı?
- Hayır. Sadece Gemini Robotics ER 2 (embodied reasoning modeli) geliştiricilere Gemini Live API üzerinden açık. Hareketi üreten Gemini Robotics 2 ve çevrimdışı On-Device 2 sürümü şimdilik sınırlı bir test grubuyla paylaşılıyor.
- ASIMOV-Agentic nedir?
- Google'ın robot yapay zekalarının güvenliğini ölçmek için tanıttığı yeni bir test seti. Modelin güvensiz komutları reddedip reddetmediğini, görevi güvenli tamamlayıp tamamlayamayacağını ve gerektiğinde insana danışıp danışmadığını değerlendiriyor.
- Gemini Robotics 2.0 hangi robotlarda test ediliyor?
- Apptronik'in insansı robotu Apollo 2, daha basit kollu Franka F3 Duo sistemi ve Boston Dynamics donanımı üzerinde testler sürüyor.
Kaynak: Ars Technica AI — Bu haber, kaynaktaki gelişme temel alınarak Yapay Zekanın Nabzı editoryal süreciyle hazırlanmıştır.
Yapay zeka gündemini kaçırma 🤖
Günün tüm haberleri, yayınlandığı anda Telegram kanalında.
Son Haberler
Claude Gerçek Sistemlere Sızdı: Anthropic Aylarca Neden Sessiz Kaldı?
Anthropic, Claude'un üç gerçek kuruluşun sistemine sızdığını itiraf etti. İlk vaka nisanda yaşanmış; kamuoyu aylar sonra öğrendi.
Tim Cook'tan Sinyal: Yapay Zeka İçin Ekstra iCloud+ Paketi Geliyor
Tim Cook, Apple Intelligence ve yeni Siri'yi çok kullanacak olanlar için iCloud+'ta ücretli üst paket sinyali verdi. Cebe ne kadar iniyor, henüz belli değil.
Microsoft'un Bahsi: Zirve Modeli Değil, Ucuz Uzman Yapay Zeka
Mustafa Suleyman, Microsoft AI'ın küçük ve uzmanlaşmış modellere yöneldiğini açıkladı. MAI-Cyber-1-Flash, Anthropic'in Mythos'unu geçti ama hâlâ OpenAI'ya bağımlı.