TRACES er Apodex’ benchmark for såkaldt discoverative AI: I stedet for at sammenholde et svar med en facitliste vurderer den, hvordan et AI system undersøger et åbent videnskabeligt problem. Benchmarken måler seks evner – Tools, Repair, Alternatives, Coherence, Evidence og Scope – så kvaliteten af en undersøgelse ka...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Apodex’s TRACES benchmark, launched to evaluate “discoverative AI,” how does it move beyond traditional answer-key benchmarks by pla. Article summary: TRACES is Apodex’s “reality benchmark” for evaluating discoverative AI: systems intended to investigate open scientific problems and reach potentially unknown conclusions, rather than retrieve a predefined answer. It eva. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
De fleste AI-benchmarks stiller et spørgsmål og sammenholder derefter systemets svar med en kendt facitliste. Apodex’ TRACES går en anden vej: Her placeres et komplet AI-system – det, Apodex kalder en “heavy-duty solver” – i et eksekverbart og tilstandsbaseret miljø, hvor systemet skal undersøge et åbent videnskabeligt problem.
AI’en kan bruge værktøjer, modtage feedback, opdage fejl, ændre strategi og arbejde sig frem mod konklusioner, som endnu ikke nødvendigvis er afklaret.
Det er en vigtig forskel. Et overbevisende slutresultat kan være et heldigt gæt, være dårligt dokumenteret eller være umuligt at genskabe. TRACES forsøger derfor at vurdere både resultatet og den undersøgelse, der førte frem til det.
TRACES er en del af Apodex Discovery – en ramme til at udvikle og evaluere det, Apodex kalder “discoverative AI”. Det er systemer, der skal nå frem til potentielt nye konklusioner i stedet for blot at hente eller omformulere allerede kendt information.
Benchmarken bruger eksekverbare miljøer, episoder, opgaver og skjulte verifikatorer for at gøre åbne undersøgelser mulige at teste.
Det, der evalueres, er ikke kun en grundmodel. En submission består af hele solver-systemet: modellen, den tekniske orkestrering, værktøjer, hukommelse og de kontrolpolitikker, som systemet bruger undervejs.
I traditionelle benchmarks er spørgsmålet, inputtet og det forventede svar som regel defineret på forhånd. TRACES begynder i stedet med et virkelighedsnært mål, som systemet skal omsætte til en konkret og gennemførlig undersøgelse.
Solver-systemet interagerer med et miljø, udfører handlinger, kalder videnskabelige eller beregningsmæssige værktøjer og modtager feedback, der minder om resultater fra eksperimenter eller verifikatorer.
Det giver et længere evalueringsforløb:
Benchmarken registrerer dermed undersøgelsens forløb – ikke kun om det endelige svar ligner et referencesvar. Det er særligt relevant, når det videnskabelige spørgsmål ikke har et fastslået svar, som kan fungere som traditionel ground truth.
Akronymet beskriver seks dimensioner af procesverifikation, som også omtales som HDS6:
Samlet skal dimensionerne gøre det muligt at skelne mellem en pålidelig undersøgelse og et selvsikkert, men udokumenteret gæt. De giver også mulighed for at vurdere kvaliteten af systemets arbejdsproces, selv når der endnu ikke findes et endeligt svar.
Apodex Discovery peger på flere forudsætninger for at kunne evaluere åben opdagelse: et veldefineret problem, et virkelighedsbaseret miljø, mekanismer til verifikation og feedbacksløjfer, der giver systemet mulighed for at rette sit arbejde. TRACES er benchmark-implementeringen af denne tilgang.
I forbindelse med kortlægningen af relevante problemer oplyser Apodex, at virksomheden undersøgte 561 industrier på tværs af 16 sektorer og samlede 423 værdifulde problemer fra den virkelige verden. Den første udgivelse udvalgte 20 problemer til eksekverbar evaluering.
De tilgængelige materialer nævner blandt andet områder som:
Eksemplerne viser den tilsigtede bredde, men de foreliggende kilder dokumenterer ikke en komplet, offentlig oversigt over alle opgaver eller domæner i udgivelsen.
AI-systemer bruges i stigende grad – eller foreslås brugt – til at generere hypoteser, vælge forskningsretninger, analysere eksperimentelle resultater og hjælpe med at planlægge gentagne arbejdsgange. I den type opgaver er velformuleret tekst ikke nok.
Systemet skal kunne afgøre, hvad der bør testes, fortolke resultatet, komme videre efter fejl og undgå at konkludere mere, end evidensen kan bære.
TRACES behandler derfor videnskabelig undersøgelse som en interaktiv proces. Et system, der når frem til et nyttigt resultat gennem dokumenterbar evidens og passende justeringer, er væsentligt forskelligt fra et system, der leverer en lignende konklusion uden en holdbar vej dertil.
Tilgangen fjerner dog ikke behovet for menneskeligt tilsyn. Forskere og fageksperter skal fortsat fastlægge mål og begrænsninger, vurdere etiske og praktiske risici, kontrollere antagelser og evidens og afgøre, om en konklusion kan begrunde handling i den virkelige verden.
TRACES’ fokus på gennemskuelige forløb og afgrænsede påstande er netop relevant, fordi det giver dem, der vurderer systemet, mere at undersøge end en isoleret slutpåstand.
Apodex’ offentlige annoncering beskriver et åbent kald efter både solver-systemer og videnskabelige problemer.
En solver-submission skal repræsentere det komplette system, der bruges til at undersøge en opgave – ikke kun den underliggende model. Det omfatter blandt andet orkestreringslaget, værktøjer, hukommelse og kontrolpolitik.
Et problemforslag skal kunne beskrives som et eksekverbart og verificerbart miljø. I praksis kræver det en definition af, hvad systemet kan observere og gøre, hvilken feedback det modtager, og hvordan mellemresultater eller endelige påstande kan kontrolleres efter tydelige succeskriterier.
TRACES ændrer benchmark-spørgsmålet fra “Gav AI’en det forventede svar?” til “Gennemførte AI’en en disciplineret undersøgelse, der var forankret i evidens?”
Det gør benchmarken bedre egnet til videnskabelig opdagelse end statiske tests med facitlister. Samtidig har metoden en klar begrænsning: Procesmålinger kan forbedre evalueringen, men de kan ikke i sig selv bevise, at en AI-genereret opdagelse er sikker, nyttig eller klar til at blive taget i brug. Menneskelig videnskabelig dømmekraft er fortsat afgørende.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TRACES er Apodex’ benchmark for såkaldt discoverative AI: I stedet for at sammenholde et svar med en facitliste vurderer den, hvordan et AI system undersøger et åbent videnskabeligt problem.
TRACES er Apodex’ benchmark for såkaldt discoverative AI: I stedet for at sammenholde et svar med en facitliste vurderer den, hvordan et AI system undersøger et åbent videnskabeligt problem. Benchmarken måler seks evner – Tools, Repair, Alternatives, Coherence, Evidence og Scope – så kvaliteten af en undersøgelse kan vurderes, selv når der ikke findes et endeligt facit.
Hold kan deltage ved at indsende et komplet solver system eller foreslå et videnskabeligt problem, der kan omsættes til et eksekverbart og verificerbart miljø.