← terug naar overzicht

HybridInfer: thermisch bewuste tier-routing via reinforcement learning voor LLM-inferentie op apparaat, edge en cloud

onderzoek 📅 2026-09-29
6. Aankondigingstype: nieuw. Samenvatting: Inferentie op het apparaat met kleine taalmodellen houdt gebruikersdata lokaal, werkt offline en brengt geen kosten per query met zich mee, dus de on-device-laag heeft de voorkeur wanneer die volstaat. De laag is echter thermisch beperkt, en ik constateer dat de beperking scherper is dan alleen een vertraging: op een vlaggenschip Snapdragon-apparaat destabiliseert aanhoudende on-device-generatie de GPU-inferentieruntime, die crasht of stilzwijgend vastloopt na enkele opeenvolgende queries. Het falen ligt in...

🔗 lees originele bron