Laat je agent video-demo's van zijn werk opnemen met shot-scraper video
arXiv:2606.28406v1 Aankondigingstype: nieuw Abstract: Tekst-naar-beeld- en multimodale generatieve modellen worden steeds vaker gebruikt om wetenschappelijke figuren te produceren, zoals mechanismediagrammen, schema's van experimentele opzet, conceptuele kaders en grafische samenvattingen. Toch evalueren bestaande benchmarks voor beeldgeneratie (zoals GenEval, T2I-CompBench, DPG-Bench) natuurlijke beelden en meten ze compositie, objecttelling of fotorealisme. Geen van deze benchmarks meet wat een gegenereerde wetenschappelijke figuur bruikbaar maakt: corr
🔗 lees originele bron