LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels

ArXiv’de yayımlanan “LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels” (2603.19312) başlıklı makale, yapay zeka ve robotik alanında “dünya modelleri” (world models) üzerine önemli bir yenilik getirmektedir.


Genel Bakış ve Problem

Yapay zekanın fiziksel dünyayı anlaması için geliştirilen JEPA (Joint-Embedding Predictive Architecture) yaklaşımları, dünyayı karmaşık pikseller yerine daha kompakt “gizli uzaylarda” (latent spaces) modellemeyi hedefler. Ancak önceki yöntemler oldukça hassastı; eğitim sırasında “temsil çökmesi” (representation collapse - modelin her girdiye aynı çıktıyı vermesi) sorunu yaşıyorlardı. Bu sorunu aşmak için çok sayıda karmaşık parametreye ve önceden eğitilmiş modellere ihtiyaç duyuluyordu.

LeWorldModel (LeWM) Nedir?

Lucas Maes, Yann LeCun ve ekibi tarafından sunulan LeWM, ham piksellerden uçtan uca (end-to-end) ve kararlı bir şekilde eğitilebilen ilk JEPA tabanlı dünya modelidir.

Sistemin temel özellikleri:

  • Basitleştirilmiş Eğitim: Önceki modellerde 6 olan ayarlanabilir hiper-parametre sayısı 1’e indirilmiştir.

  • İki Terimli Kayıp Fonksiyonu: Karmaşık matematiksel formüller yerine sadece iki temel terim kullanılır:

    1. Gelecek Tahmin Kaybı: Bir sonraki durumun gizli uzayda ne olacağını tahmin eder.

    2. Düzenleyici (SIGReg): Gizli uzaydaki verilerin belirli bir dağılımda (Gaussian) kalmasını sağlayarak modelin çökmesini engeller.


Öne Çıkan Sonuçlar

  1. Yüksek Hız: LeWM, büyük temel modeller (foundation models) kullanan rakiplerine göre planlama aşamasında 48 kat daha hızlıdır.

  2. Verimlilik: Sadece 15 milyon parametreye sahiptir ve standart bir GPU üzerinde birkaç saat içinde eğitilebilir.

  3. Fiziksel Anlayış: Modelin gizli uzayı, nesnelerin konumunu ve hızını açıkça öğretilmeden öğrenebilir. Ayrıca, nesnelerin ışınlanması gibi fiziksel olarak imkansız olayları (“sürpriz” testi) tespit edebilmektedir.

  4. Kontrol Başarısı: Hem 2D hem de 3D kontrol görevlerinde (robotik kol hareketleri vb.) karmaşık modellerle yarışır düzeyde performans sergiler.


Neden Önemli?

Bu çalışma, karmaşık mühendislik hilelerine veya devasa işlem güçlerine ihtiyaç duymadan, bir yapay zekanın dünyayı sadece piksellere bakarak kararlı bir şekilde öğrenebileceğini kanıtlamaktadır. Özellikle düşük kaynaklı sistemlerde ve hızlı karar verilmesi gereken robotik sistemlerde devrim yaratma potansiyeline sahiptir.