← terug naar overzicht

Verbeterde betrouwbaarheidsschattingen voor black-box grote taalmodellen

onderzoek 📅 2026-08-21
Onzekerheidskwantificering (UQ) is essentieel voor de veilige inzet van large language models (LLM's). Bestaande methoden, van verbale betrouwbaarheid tot methoden die meerdere generaties vereisen, zijn vaak zero-shot en produceren scores die onzekerheid kwantificeren zonder dat gelabelde data nodig is. Toch moet men in de praktijk altijd hun prestaties evalueren op een relevante dataset vóór inzet. In dit werk tonen we aan dat, door gebruik te maken van deze dataset,

🔗 lees originele bron