← terug naar overzicht

Hiërarchische dataselectie via manifold-dekking en sparse feature-dekking in LLM-post-training

onderzoek 📅 2026-08-19
arXiv:2608.16927v1 Aankondigingstype: nieuw Abstract: Naarmate supervised fine-tuning-data blijft schalen, is het selecteren van hoogwaardige subsets uit grote kandidaatpools cruciaal om de trainingskosten te verlagen en de modelprestaties te verbeteren. Bestaande methoden meten diversiteit vaak rechtstreeks in de oorspronkelijke embeddingruimte, waar geometrische metrieken dominante semantische richtingen, fijnmazige supervisieverschillen en lokale ruis met elkaar verstrengelen. We pakken deze beperking aan door dataselectie te formuleren als een grof-naar-f

🔗 lees originele bron