← terug naar overzicht

Beweer niet dat benchmarkgerichte optimalisatie de algemene codeervaardigheid verbetert — diverse evaluatie is vereist

onderzoek 📅 2026-08-17
arXiv:2608.13566v1 Aankondigingstype: nieuw. Samenvatting: Post-training papers, modelkaarten en blogposts behandelen scores op een kleine set codeerbenchmarks (zoals SWE-bench en LiveCodeBench) vaak als bewijs van brede codeervaardigheid, zowel voor onderzoeksartefacten als voor gebruikersgerichte systemen. Wij stellen dat optimalisatie voor deze benchmarks leidt tot het meten van taakspecifieke prestaties, waardoor een betekenisverschil ontstaat tussen gemeten scores en claims van algemene codeervaardigheid. We onderzoeken dit verschil met een op Django gebaseerde

🔗 lees originele bron