Dit AI-drevne produkt, evalueret.
Træning og benchmarking af modeller er de førende AI-laboratoriers opgave. Din opgave er at sikre, at dit produkt, AI'en inklusive, gør det, dine brugere har brug for. eva måler netop det, peger på koden bag hvert resultat og foreslår, hvad der skal ændres.
| Criterion | Result |
|---|---|
| Row 1 · Eva judgesKeeps every suggestion within the stated budget | Met |
| Row 2 · Eva judgesMentions entry requirements for the destination | Not met |
| Row 3 · your users answerTravellers find the itinerary useful | Not enough observations |
| Row 4 · Eva judgesOnly suggests flights that actually exist | Met |
| Row 5 · your users answerTravellers feel in control of the plan | Not enough observations |
Fire dele, ét loop
Read it
Eva læser din kode og kortlægger hver komponent, så hvert resultat peger på koden bag det.
Define it
I bliver enige om, hvad godt betyder, med en beståelsesgrænse for hvert kriterium, før nogen svarer.
Measure it
Dine brugere svarer på en kort test i dit produkt, eller Eva vurderer din AI's faktiske output.
Act on it
For hver række, der ikke er opfyldt, foreslår Eva en handling. Du accepterer den, og en person på dit team merger den.
Det er let at finde problemer. Det er svært at vide, hvad der skal ændres.
Forskning i brugervenlighed peger igen og igen på det samme: Test med brugere afdækker problemer, men teams har svært ved at omsætte dem til ændringer i designet, og det, udviklere sætter mest pris på, er et konkret forslag til, hvad der skal ændres.
eva er bygget op om netop det trin: Hver række, der ikke er opfyldt, kommer med et forslag til en ændring i koden bag den.
Udviklere vurderede redesignforslag som mere nyttige i deres arbejde end lister over brugervenlighedsproblemer.
Hornbæk & Frøkjær · CHI 2005Hvilke brugervenlighedsproblemer der bliver løst, afhænger lige så meget af udviklerne som af problemerne: udviklereffekten.
Law · Int. Journal of Human–Computer Interaction, 2006Mål. Handl. Mål igen.
Én måling viser, hvor du står. Eva fortsætter, én iteration ad gangen, og hver iteration viser, om de seneste ændringer virkede.
Det meste evaluering af AI-produkter er et regneark fyldt med meninger eller et benchmark, der måler noget, ingen har bedt om. Ingen af delene fortæller dig, hvad du skal ændre. Vi bygger Eva, så hvert resultat peger på koden bag det, og hver ændring bliver målt igen.
Bliv et af de første teams, der bruger Eva
Eva er endnu ikke lanceret. Fortæl os lidt om dit produkt, så vender vi tilbage.