Vad är en benchmark inom AI?
En benchmark är en standardiserad test eller mått som används för att utvärdera och jämföra AI-systems prestanda.
Definition
En benchmark inom AI är en standardiserad test, dataset eller uppsattning kriterier som används för att mäta och jämföra prestandan hos olika AI-system eller modeller.
Syfte
Benchmarks tillhandahåller objektiva mätningar som möjliggör jämförelse mellan olika AI-system, spårning av framsteg över tid och identifiering av styrkor och svagheter.
Funktion
Benchmarks definierar specifika uppgifter, datasets och utvärderingsmätningar som AI-system testas mot för att producera standardiserade prestationsmått.
Exempel
ImageNet för bildigenkänning, GLUE för språkförståelse, BLEU för maskinöversättning och SuperGLUE för avancerad språkbearbetning.
Relaterat
Evals, Ground Truth, Model Evaluation, Performance Metrics
Vous voulez en savoir plus ?
Si vous souhaitez approfondir Benchmark —ou proposer ce type de formation à votre équipe— discutons-en. J'aide les équipes à comprendre et à appliquer ces concepts. J'ai hâte d'avoir de vos nouvelles !
Vad är Evals?
Evals (evaluations) är systematiska tester och bedömningsmetoder som använd...
Vad är en syntetisk persona?
En syntetisk persona är en artificiellt skapad digital karaktär eller ident...
Vad är ett GPU Cluster?
Ett GPU Cluster är en samling av flera grafikkort (GPUs) som är sammankoppl...
Vad är en AI-agent?
En AI-agent är ett autonomt system som kan uppfatta sin miljö, behandla inf...
Vad är Few-Shot Learning?
Few-Shot Learning är en maskininlärningsteknik där AI-modeller kan lära sig...