← terug naar overzicht

Data-DPO: Direct Preference Optimization voor dataselectie van het doelmodel in LLM-post-training

onderzoek 📅 2026-08-19
arXiv:2608.16926v1 Aankondigingstype: nieuw Abstract: Dataselectie bij supervised fine-tuning heeft als doel een kleine set effectieve samples te selecteren uit grootschalige kandidaatdata, om zo de trainingskosten te verlagen terwijl de modelprestaties behouden blijven. Bestaande methoden behandelen de waarde van data echter meestal als een relatief statische eigenschap en besteden weinig aandacht aan de compatibiliteit tussen de data en de capaciteitsverdeling van het doelmodeel. Om dit probleem aan te pakken stellen we Data-DPO voor, een op het doelmodeel gerichte SFT-da

🔗 lees originele bron