Ana içeriğe geç

Haber · Araştırma

EvolveScaler: Tencent ve Renmin Üniversitesi'nden bilgi-evrim kıyaslama çerçevesi

Yürütülebilir durum makineleri ve doğal dil oluşturma tekniklerini birleştiren yeni bir çerçeve ve veri kümesi, büyük dil modellerinin değişen bilgiyi işleme kapasitesini ölçmek amacıyla kamuoyuyla paylaşıldı.

2 dk okuma Kaynak: github.com

Ne değişti: Tencent Hunyuan ve Renmin Üniversitesi, bilgi evrimini ölçen yürütülebilir durum makinesi tabanlı bir çerçeveyi ve eşlik eden veri kümesini kamuoyuyla paylaştı.

Tencent Hunyuan ekibi ile Renmin Üniversitesi'nin Gaoling Yapay Zeka Okulu, 'EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering' başlıklı bir araştırma makalesi için GitHub deposu ve proje sitesini yayımladı. Çerçeve, bilginin zaman içinde nasıl değiştiğini simüle ederek büyük dil modelleri için eğitim ve değerlendirme verisi üretmeyi amaçlıyor. Çalışmanın yazarları arasında Ziliang Zhao, Zenan Xu, Shuting Wang, Zhao Wang, Bowen Cao, Minda Hu, Lincheng Li, Pluto Zhou ve Zhicheng Dou yer alıyor; Zhao ile Xu eşit katkı sağlarken Zhou ve Dou sorumlu yazarlar olarak belirtiliyor.

EvolveScaler üç aşamalı bir süreç üzerine kurulu: ilk aşamada açıklamalayıcılar iş akışlarını türlendirilmiş geçişler olarak tanımlıyor; ikinci aşamada bir büyük dil modeli bu tanımları yürütülebilir simülatörlere derliyor; üçüncü aşamada ise simülatörler tekrar oynatma yoluyla hem doğal dil diyalogu hem de deterministik biçimde hesaplanmış referans yanıtlar üretiyor. Veri kümesi 12 tematik alan genelinde 117 görev prototipi ve yaklaşık 35.100 eğitim örneği içeriyor. Değerlendirme için doğrulanmış 585 örnek sunuluyor; bu örneklerdeki olay sayısı beş zorluk katmanına göre yaklaşık 7 ile 1.200 arasında değişiyor.

Kıyaslama sonuçları, bağlam uzunluğunun model başarımı üzerindeki etkisini somut biçimde ortaya koyuyor. En güçlü modelin 'very_long' katmanında avg@5 bazında yüzde 59,3 başarı elde ettiği gözlemlenirken, altı modelin en uzun bağlamlarda yüzde 10'un altında kaldığı görülüyor. Buna ek olarak, veri kümesinden derlenen 6.000 örnekle eğitilen dahili A3B modeli sekiz bağımsız kıyaslamada ortalama 5,25 puanlık bir kazanım sağladı. Depo, Tencent-Hunyuan GitHub organizasyonu altında kamuya açık olarak yayımlandı.

Temel bulgular

  • Çerçeve üç aşamada çalışıyor: iş akışı tanımı, LLM tabanlı simülatör derleme ve deterministik referans yanıtlar üretimi.
  • Veri kümesi 12 tematik alanda 117 görev prototipi, yaklaşık 35.100 eğitim örneği ve 585 doğrulanmış değerlendirme örneği içeriyor.
  • En güçlü model 'very_long' katmanında avg@5 bazında yüzde 59,3 başarı elde etti; altı model en uzun bağlamlarda yüzde 10'un altında kaldı.
  • Dahili A3B modeli 6.000 örnekle eğitildikten sonra sekiz bağımsız kıyaslamada ortalama 5,25 puanlık kazanım sağladı.
  • Depo, Tencent-Hunyuan GitHub organizasyonu altında kamuya açık olarak yayımlandı.

Neden önemli

Bağlam uzunluğu arttıkça model başarımının belirgin biçimde düştüğünü belgeleyen bu veri kümesi, mevcut büyük dil modellerinin değişen bilgiyi takip etme kapasitesindeki sınırlılıkları ölçülebilir kanıtlarla ortaya koyuyor.

İzlenecek: Makalenin yayımlandığı resmi mekan ile 'A3B' model kimliği henüz açıklanmadı; bu bilgilerin kamuoyuyla paylaşılması bekleniyor.

Kaynak tarihi: 2026-09-09T06:21:05.327Z · Doğrulama güveni: 92/100

İlgili içerikler

İlk görüşme

Ne yapmak istediğinizi anlatın, nereden başlayacağımızı birlikte belirleyelim.

İlk görüşmede işinizi, şu anki durumunuzu ve önceliğinizi konuşuruz. Hangi parçayı bizim üstlenmemizin mantıklı olduğunu ve neyi sizin yönetmeniz gerektiğini açıkça söyleriz.

Çerez ve ölçüm tercihi

Site çalışması için gerekli olanlar dışında ölçüm veya reklam etiketi yalnız izin verirseniz çalışır. Şu an bu sitede ölçüm etiketi etkin değildir. Ayrıntılar