Daha iyi yapılandırılmış daha küçük bir model
Bağımsız araştırmaDeğerlendirme ve teknik makaleMakalеyi oku
Dört kombinasyonu karşılaştırdım: daha küçük ve daha büyük dil modelleri, her biri bilgi grafiği ile ve olmadan. Değerlendirme, çok adımlı soruları, varlık anlamsallaştırmasını, küme işlemlerini, belge kapsamını, tutarlılığı, maliyeti ve gecikmeyi kapsadı.
Yararlı sonuç, daha küçük modellerin her zaman kazandığı değildi. Kazanmıyorlar. Mimarinin model boyutundan daha önemli olabileceğiydi. 35 başa başa testten, grafik araçları olan Llama 3.1 8B, onlar olmayan Llama 3.3 70B'yi geçti: %55 daha yüksek temel değerlendirme puanı, giriş jetonları milyon başına 0,075 dolar yerine 1,00 dolar ve ortalama gecikme 8,8 saniye yerine 2,9 saniye. Ayrıca her cevap için doğrulanabilir bir araç-çağrı zinciri üretti, sadece 70B model yapamadığı bir şey.
Metodoloji, kategori düzeyinde sonuçlar, sınırlamalar ve sistem tasarımını yayımladım çünkü bu uzlaşma, başka biri bunu incelediğinde daha yararlı olur.