Privacy zonder spijt: differentieel private alignment tijdens inferentie
arXiv:2608.26324v1 Aankondigingstype: nieuw Samenvatting: Best-of-N (BoN)-sampling is de eenvoudigste en meest gebruikte afstemmingsstrategie op inferentietijd, maar kampt met twee afzonderlijke problemen: reward hacking, waarbij de geselecteerde respons fouten in het proxy-beloningsmodel uitbuit, en het ontbreken van enige privacybescherming voor de gevoelige menselijke voorkeursdata die worden gebruikt om dat beloningsmodel te trainen. We tonen aan dat één enkele interventie — het toevoegen van gekalibreerde ruis aan beloningsscores vóór selectie — beide problemen oplost.
🔗 lees originele bron