CARPRT: klassebewuste zero-shot prompt-herweging voor black-box visie-taalmodellen
Een voorgetraind vision-language model maakt zero-shot beeldclassificatie mogelijk door gelijkenisscores te berekenen tussen een afbeelding en tekstuele beschrijvingen — doorgaans een klassenlabel ingevoegd in een prompt. Omdat de score per beeld-klassepaar gevoelig is voor de promptkeuze, combineren bestaande studies meerdere prompts met een wegingsvector.
🔗 lees originele bron