AI-zoekagenten falen niet in het zoeken zelf, maar in het stellen van de juiste vragen bij vage zoekopdrachten
AI-zoekagenten falen zelden bij meervoudig onderzoek vanwege het zoeken zelf — hun echte probleem is dat ze de gebruiker niet om verduidelijking vragen wanneer zoekopdrachten dubbelzinnig zijn. Een nieuwe benchmark genaamd DiscoBench toont aan dat modellen die herhaaldelijk zoeken in plaats van vervolgvragen te stellen juist slechter presteren, met 51,9 procent, dan modellen die gewoon gokken. Zelfs het beste model haalt slechts 43 procent algehele nauwkeurigheid. Wanneer de dubbelzinnigheid uit de zoekopdrachten wordt gehaald, schiet de nauwkeurigheid met wel 40 punten omhoog.
🔗 lees originele bron