Over robuustheid en chain-of-thought-consistentie van RL-gefinetunede VLM's
Reinforcement learning-finetuning is een belangrijke techniek geworden om grote taalmodellen te verbeteren op redeneerintensieve taken, wat de uitbreiding naar visie-taalmodellen motiveert. Hoewel RL-getunede visie-taalmodellen beter scoren op visuele redeneerbenchmarks, blijven ze kwetsbaar voor zwakke visuele verankering, hallucinaties en overmatig vertrouwen op tekstuele signalen. We tonen aan dat eenvoudige, gecontroleerde tekstuele verstoringen — misleidende bijschriften of onjuiste chain-of-thought-sporen — aanzienlijke prestatieverliezen veroorzaken.
🔗 lees originele bron