FAMPWQ: op Fisher-informatie gebaseerde adaptieve mixed-precision gewichtsquantisatie voor effectieve LLM-inferentie
arXiv:2608.24945v1 Aankondigingstype: nieuw Samenvatting: De afgelopen jaren zijn er opmerkelijke prestaties geleverd door Large Language Models (LLM's) in meerdere domeinen, terwijl de buitensporige resource-eisen van LLM's de inzet op apparaten met beperkte middelen belemmeren. Hoewel modelkwantisering een effectieve aanpak is, leiden conventionele kwantiseringsmethoden doorgaans tot ernstige prestatievermindering door uniforme bitbreedte of eenvoudige heuristische gevoeligheidsevaluatie. In dit artikel stellen we voor
🔗 lees originele bron