Ne değişti: Tencent Hunyuan ve Renmin Üniversitesi, bilgi evrimini ölçen yürütülebilir durum makinesi tabanlı bir çerçeveyi ve eşlik eden veri kümesini kamuoyuyla paylaştı.
Tencent Hunyuan ekibi ile Renmin Üniversitesi'nin Gaoling Yapay Zeka Okulu, 'EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering' başlıklı bir araştırma makalesi için GitHub deposu ve proje sitesini yayımladı. Çerçeve, bilginin zaman içinde nasıl değiştiğini simüle ederek büyük dil modelleri için eğitim ve değerlendirme verisi üretmeyi amaçlıyor. Çalışmanın yazarları arasında Ziliang Zhao, Zenan Xu, Shuting Wang, Zhao Wang, Bowen Cao, Minda Hu, Lincheng Li, Pluto Zhou ve Zhicheng Dou yer alıyor; Zhao ile Xu eşit katkı sağlarken Zhou ve Dou sorumlu yazarlar olarak belirtiliyor.
EvolveScaler üç aşamalı bir süreç üzerine kurulu: ilk aşamada açıklamalayıcılar iş akışlarını türlendirilmiş geçişler olarak tanımlıyor; ikinci aşamada bir büyük dil modeli bu tanımları yürütülebilir simülatörlere derliyor; üçüncü aşamada ise simülatörler tekrar oynatma yoluyla hem doğal dil diyalogu hem de deterministik biçimde hesaplanmış referans yanıtlar üretiyor. Veri kümesi 12 tematik alan genelinde 117 görev prototipi ve yaklaşık 35.100 eğitim örneği içeriyor. Değerlendirme için doğrulanmış 585 örnek sunuluyor; bu örneklerdeki olay sayısı beş zorluk katmanına göre yaklaşık 7 ile 1.200 arasında değişiyor.
Kıyaslama sonuçları, bağlam uzunluğunun model başarımı üzerindeki etkisini somut biçimde ortaya koyuyor. En güçlü modelin 'very_long' katmanında avg@5 bazında yüzde 59,3 başarı elde ettiği gözlemlenirken, altı modelin en uzun bağlamlarda yüzde 10'un altında kaldığı görülüyor. Buna ek olarak, veri kümesinden derlenen 6.000 örnekle eğitilen dahili A3B modeli sekiz bağımsız kıyaslamada ortalama 5,25 puanlık bir kazanım sağladı. Depo, Tencent-Hunyuan GitHub organizasyonu altında kamuya açık olarak yayımlandı.
Temel bulgular
- Çerçeve üç aşamada çalışıyor: iş akışı tanımı, LLM tabanlı simülatör derleme ve deterministik referans yanıtlar üretimi.
- Veri kümesi 12 tematik alanda 117 görev prototipi, yaklaşık 35.100 eğitim örneği ve 585 doğrulanmış değerlendirme örneği içeriyor.
- En güçlü model 'very_long' katmanında avg@5 bazında yüzde 59,3 başarı elde etti; altı model en uzun bağlamlarda yüzde 10'un altında kaldı.
- Dahili A3B modeli 6.000 örnekle eğitildikten sonra sekiz bağımsız kıyaslamada ortalama 5,25 puanlık kazanım sağladı.
- Depo, Tencent-Hunyuan GitHub organizasyonu altında kamuya açık olarak yayımlandı.
Neden önemli
Bağlam uzunluğu arttıkça model başarımının belirgin biçimde düştüğünü belgeleyen bu veri kümesi, mevcut büyük dil modellerinin değişen bilgiyi takip etme kapasitesindeki sınırlılıkları ölçülebilir kanıtlarla ortaya koyuyor.
İzlenecek: Makalenin yayımlandığı resmi mekan ile 'A3B' model kimliği henüz açıklanmadı; bu bilgilerin kamuoyuyla paylaşılması bekleniyor.
Kaynak tarihi: 2026-09-09T06:21:05.327Z · Doğrulama güveni: 92/100