AI-benchmarks hebben een vertrouwensprobleem en Google wil dat oplossen
Google DeepMind test voor het eerst een dubbelblinde evaluatie van een frontier-AI-model. Cryptografische bescherming via Confidential Space moet voorkomen dat Google de testvragen kan zien en dat de beoordelaars de modelgewichten kunnen zien. Het pilotproject met het Singapore AI Safety Institute gebruikt een Gemini Flash Lite en zou een nieuwe standaard kunnen zetten voor fraudebestendige AI-benchmarks. Het artikel "AI benchmarks have a trust problem and Google wants to fix it" verscheen eerst op The Decoder.
🔗 lees originele bron