OpenAI Jalapeño 🌶️, Perplexity Portable Computer 💻, Claude combineert geheugen 🧠
arXiv:2608.23573v1 Aankondigingstype: nieuw Samenvatting: De gewichtsgroottes van een getrainde transformer zijn samen te vatten in een tweeparameter-Weibullverdeling waarvan de vorm k ≈ 1,2 stabiel is over lagen en modellen heen, zodat de schaal λ het grootste deel van de door training veroorzaakte beweging draagt. Welke corpus-eigenschap bepaalt hoeveel λ groeit? Met behulp van de bigram conditionele entropie D = H(volgende | vorige), een trainingsvrije statistiek die vóór de training wordt berekend, vinden we over gecontroleerde corruptiefamilies heen
🔗 lees originele bron