Co je benchmark v AI?
Standardizované testy nebo metriky pro měření a porovnání výkonu AI modelů a systémů.
Definice
Benchmark je standardizovaný soubor testů, datasetů a metrik používaných k měření a porovnání výkonu různých AI modelů a systémů.
Účel
Benchmarky umožňují objektivní porovnání mezi různými AI modely, měří technologický pokrok a pomáhají identifikovat nejlepší řešení pro specifické úkoly.
Funkce
Benchmarky poskytují standardizované datasety, evaluační metriky a testovací procedury, které umožňují reprodukovatelné a spravedlivé porovnání.
Příklad
GLUE (porozumění přirozenému jazyku), ImageNet (klasifikace obrázků), SuperGLUE (jazykové uvažování) a MLPerf (výkon machine learning).
Related
Benchmarky úzce souvisí s Evaluations (Evals), Ground Truth, Model Evaluation a Performance Measurement.
Vous voulez en savoir plus ?
Si vous souhaitez approfondir Benchmark —ou proposer ce type de formation à votre équipe— discutons-en. J'aide les équipes à comprendre et à appliquer ces concepts. J'ai hâte d'avoir de vos nouvelles !
Co je Latency Budget?
Latency Budget neboli Rozpočet latence je maximální přijatelný čas odezvy d...
Co je Ground Truth?
Ground Truth jsou správné, ověřené nebo referenční odpovědi a data používan...
Co je Latency v AI?
Latency neboli Latence je čas, který uplyne mezi odesláním dotazu nebo poža...
Co je context window?
Context Window je omezená délka vstupního textu nebo dat, kterou AI model d...
Co je Grounding?
Grounding neboli Zakotvení je proces připojení AI systémů k ověřitelným, re...