TRACES er Apodex’ benchmark for såkalt «discoverative AI» – KI som skal undersøke åpne problemer og nå potensielt nye konklusjoner, ikke bare gjengi et kjent svar. Benchmarken vurderer seks evner: verktøybruk, feilretting, alternativer, sammenheng, evidens og påstandenes rekkevidde.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Apodex’s TRACES benchmark, launched to evaluate “discoverative AI,” how does it move beyond traditional answer-key benchmarks by pla. Article summary: TRACES is Apodex’s “reality benchmark” for evaluating discoverative AI: systems intended to investigate open scientific problems and reach potentially unknown conclusions, rather than retrieve a predefined answer. It eva. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
De fleste KI-tester fungerer som en skoleprøve: Systemet får et spørsmål, og svaret sammenlignes med en kjent fasit. Apodex’ TRACES prøver å måle noe vanskeligere – selve undersøkelsen som leder frem til et svar.
I benchmarken plasseres et komplett KI-system i et kjørbart og tilstandsbevisst miljø. Systemet kan observere, bruke verktøy, få tilbakemeldinger, oppdage feil, endre kurs og arbeide mot en konklusjon som kanskje ikke allerede er etablert.
Forskjellen er viktig. Et overbevisende svar kan være et heldig treff, svakt dokumentert eller umulig å gjenskape. TRACES skal derfor vurdere både resultatet og hvor grundig og etterprøvbart systemet kom frem til det.
TRACES er en del av Apodex Discovery, et rammeverk for å bygge og evaluere det Apodex kaller «discoverative AI» – systemer som skal nå potensielt nye konklusjoner, fremfor bare å hente frem eller omformulere kjent informasjon. Benchmarken bruker kjørbare miljøer, episoder, oppgaver og skjulte verifikatorer for å gjøre åpne undersøkelser målbare.
Det som evalueres, er ikke bare en grunnmodell. Enheten som testes, er et komplett «heavy-duty solver»-system: modellen sammen med orkestreringslaget, verktøyene, minnet og kontrollreglene som brukes i undersøkelsen.
I en tradisjonell benchmark er spørsmålet, datagrunnlaget og forventet svar som regel bestemt på forhånd. TRACES starter i stedet med en virkelighetsnær ambisjon som må gjøres om til en håndterbar undersøkelse. Løseren samhandler med et miljø, utfører handlinger, bruker vitenskapelige eller beregningsbaserte verktøy og mottar tilbakemeldinger som kan ligne resultater fra et eksperiment eller en verifikator.
Det gir en lengre evalueringssløyfe:
Benchmarken registrerer dermed undersøkelsesforløpet, ikke bare om sluttsvaret ligner på et referansesvar. Det er særlig relevant når det vitenskapelige spørsmålet ikke har en etablert fasit som kan fungere som vanlig «ground truth».
Akronymet viser til seks dimensjoner for verifisering av prosessen, også omtalt som HDS6:
Til sammen skal disse dimensjonene skille en pålitelig undersøkelse fra en selvsikker, men udokumentert gjetning. De gjør det også mulig å vurdere kvaliteten på arbeidsprosessen når et endelig svar ennå ikke er tilgjengelig.
Apodex Discovery beskriver flere forutsetninger for å evaluere åpen oppdagelse: et godt utformet problem, et virkelighetsbasert miljø, mekanismer for verifisering og sløyfer som lar systemet reparere arbeidet sitt. TRACES er benchmark-implementeringen av denne tilnærmingen.
Apodex opplyser at selskapet kartla 561 bransjer i 16 sektorer og samlet 423 høyverdige problemer fra den virkelige verden. Den første utgaven valgte ut 20 problemer for kjørbar evaluering.
Materialet nevner blant annet oppgaver innen:
Eksemplene viser hvilken bredde benchmarken er ment å ha, men materialet som er tilgjengelig her, gir ikke en komplett offentlig oversikt over alle oppgavene eller fagområdene i utgivelsen.
KI-systemer brukes i økende grad – eller foreslås brukt – til å generere hypoteser, velge forskningsretninger, analysere forsøksresultater og bidra til iterative arbeidsprosesser. I slike situasjoner er språklig flyt alene ikke nok. Systemet må vite hva som bør testes, forstå hva som skjedde, komme seg etter feil og unngå å hevde mer enn evidensen gir grunnlag for.
TRACES forsøker å dekke dette gapet ved å behandle vitenskapelig arbeid som en interaktiv prosess. Et system som når et nyttig resultat gjennom sporbar evidens og riktige justeringer, er noe annet enn et system som produserer en lignende konklusjon uten en solid vei dit.
Tilnærmingen fjerner ikke behovet for menneskelig kontroll. Forskere og fagspesialister må fortsatt sette mål og rammer, vurdere etiske og praktiske risikoer, kontrollere antakelser og evidens og avgjøre om en konklusjon er sterk nok til å begrunne handling i den virkelige verden. Vekten på innsyn i undersøkelsesforløpet og begrensede påstander er verdifull nettopp fordi den gir vurdererne mer å undersøke enn en isolert sluttpåstand.
Apodex’ offentlige kunngjøring beskriver en åpen invitasjon til å sende inn både løsystemer og vitenskapelige problemer.
Et løserbidrag skal representere hele systemet som brukes til å undersøke en oppgave – ikke bare grunnmodellen. Det omfatter blant annet orkestreringslaget, verktøyene, minnet og kontrollpolitikken.
Et problemforslag må kunne uttrykkes som et kjørbart og etterprøvbart miljø. I praksis innebærer det å definere hva systemet kan observere og gjøre, hvilken tilbakemelding det mottar, og hvordan mellomliggende eller endelige påstander kan kontrolleres mot tydelige kriterier for suksess.
TRACES endrer benchmark-spørsmålet fra «Ga KI-en det forventede svaret?» til «Gjennomførte KI-en en disiplinert undersøkelse som var forankret i evidens?»
Det gjør benchmarken bedre tilpasset vitenskapelig oppdagelse enn statiske tester med fasitsvar. Samtidig peker den på en viktig begrensning: Prosesspoeng kan forbedre evalueringen, men kan ikke alene fastslå at en KI-generert oppdagelse er trygg, nyttig eller klar til bruk. Menneskelig vitenskapelig skjønn er fortsatt avgjørende.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TRACES er Apodex’ benchmark for såkalt «discoverative AI» – KI som skal undersøke åpne problemer og nå potensielt nye konklusjoner, ikke bare gjengi et kjent svar.
TRACES er Apodex’ benchmark for såkalt «discoverative AI» – KI som skal undersøke åpne problemer og nå potensielt nye konklusjoner, ikke bare gjengi et kjent svar. Benchmarken vurderer seks evner: verktøybruk, feilretting, alternativer, sammenheng, evidens og påstandenes rekkevidde.
Den første utgaven bygger på 20 problemer valgt fra 423 høyverdige problemstillinger kartlagt på tvers av 561 bransjer i 16 sektorer.