TRACES ialah penanda aras Apodex untuk AI penemuan terbuka, yang menilai cara sistem menyiasat masalah dan bukannya menyemak jawapan berdasarkan kunci jawapan tetap. Penilaian merangkumi enam keupayaan: Tools, Repair, Alternatives, Coherence, Evidence dan Scope.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Apodex’s TRACES benchmark, launched to evaluate “discoverative AI,” how does it move beyond traditional answer-key benchmarks by pla. Article summary: TRACES is Apodex’s “reality benchmark” for evaluating discoverative AI: systems intended to investigate open scientific problems and reach potentially unknown conclusions, rather than retrieve a predefined answer. It eva. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Kebanyakan penanda aras AI meminta sistem menghasilkan jawapan yang boleh dibandingkan dengan jawapan rujukan. TRACES oleh Apodex mengambil pendekatan berbeza: ia meletakkan sistem AI lengkap—atau “penyelesai tugas berat”—dalam persekitaran yang boleh laku dan mempunyai keadaan tersendiri, kemudian memerhatikan bagaimana sistem itu menyiasat masalah saintifik yang masih terbuka.
Sistem tersebut boleh menggunakan alatan, menerima maklum balas, membetulkan kerja yang gagal dan mengejar kesimpulan yang belum semestinya diputuskan oleh ilmu sedia ada.
Perbezaan ini penting kerana jawapan yang kedengaran meyakinkan mungkin terhasil secara kebetulan, kurang bukti atau sukar diulang semula. TRACES direka untuk menilai proses penyiasatan di sebalik sesuatu keputusan, bukan keputusan itu sahaja.
TRACES merupakan sebahagian daripada Apodex Discovery, iaitu rangka kerja untuk membina dan menilai apa yang dipanggil Apodex sebagai “discoverative AI”—sistem yang bertujuan mencapai kesimpulan berpotensi baharu, bukannya sekadar mendapatkan semula atau menyusun semula maklumat yang sudah diketahui.
Penanda aras ini menggunakan persekitaran boleh laku, episod, tugasan dan pengesah tersembunyi supaya penyiasatan terbuka dapat diuji secara sistematik.
Unit yang dinilai bukan model asas semata-mata. Sebaliknya, TRACES menilai keseluruhan penyelesai, termasuk model, lapisan penyelarasan atau harness, alatan, memori dan dasar kawalan yang digunakan sepanjang penyiasatan.
Dalam tugasan konvensional, soalan, input dan jawapan yang dijangka biasanya telah ditetapkan lebih awal. TRACES pula bermula dengan matlamat dunia sebenar yang perlu diterjemahkan menjadi penyiasatan yang boleh dilaksanakan.
Penyelesai berinteraksi dengan persekitaran, mengambil tindakan, memanggil alatan saintifik atau pengkomputeran dan menerima maklum balas seperti keputusan eksperimen atau pengesahan.
Kitaran penilaiannya lebih panjang:
Oleh itu, TRACES merekodkan perjalanan penyiasatan, bukan hanya sama ada hasil akhir menyerupai jawapan rujukan. Pendekatan ini amat berguna apabila persoalan saintifik berkenaan belum mempunyai jawapan muktamad yang boleh dijadikan kebenaran asas konvensional.
Akronim TRACES merujuk kepada enam dimensi pengesahan proses, yang turut disebut sebagai HDS6:
Secara keseluruhan, dimensi ini bertujuan membezakan penyiasatan yang boleh dipercayai daripada tekaan yang yakin tetapi tidak berasas. Ia juga membolehkan penilai meneliti kualiti proses penyelesai walaupun jawapan muktamad belum tersedia.
Rangka kerja Apodex Discovery menetapkan beberapa keperluan untuk menilai penemuan terbuka: masalah yang dirumus dengan baik, persekitaran berasaskan realiti, mekanisme pengesahan dan gelung pembaikan yang membolehkan sistem memperbetulkan kerjanya. TRACES ialah pelaksanaan penanda aras bagi pendekatan tersebut.
Dalam proses mengenal pasti masalah, Apodex berkata pihaknya meninjau 561 industri merentasi 16 sektor dan menghimpunkan 423 masalah dunia sebenar bernilai tinggi. Pelepasan awal kemudian memilih 20 masalah untuk penilaian boleh laku.
Bahan yang tersedia menyebut contoh daripada bidang berikut:
Contoh ini menunjukkan keluasan bidang yang disasarkan, tetapi bahan yang diberikan tidak mengesahkan senarai awam lengkap bagi setiap tugasan atau domain dalam keluaran tersebut.
Sistem AI semakin digunakan—atau dicadangkan—untuk menjana hipotesis, memilih arah penyelidikan, menganalisis hasil eksperimen dan membantu mereka bentuk aliran kerja berulang. Dalam situasi seperti ini, kebolehan menghasilkan teks yang lancar tidak mencukupi.
Sistem perlu tahu perkara yang patut diuji, mentafsir keputusan, pulih daripada kesilapan dan mengelak daripada membuat dakwaan yang melampaui bukti.
TRACES cuba mengisi jurang itu dengan menganggap penyiasatan saintifik sebagai proses interaktif. Penyelesai yang mencapai hasil berguna melalui bukti yang boleh dijejaki dan pembaikan yang sesuai berbeza dengan sistem yang menghasilkan kesimpulan sama tanpa laluan penaakulan yang kukuh.
Namun, pendekatan ini tidak menghapuskan keperluan terhadap pengawasan manusia. Penyelidik dan pakar bidang masih perlu menetapkan objektif serta batasan, menilai risiko etika dan praktikal, mengesahkan andaian serta bukti, dan menentukan sama ada sesuatu kesimpulan wajar diterjemahkan kepada tindakan dunia sebenar.
Penekanan TRACES terhadap trajektori yang boleh diperiksa dan dakwaan yang terhad amat berguna kerana penilai mendapat lebih banyak bahan untuk diteliti berbanding satu pernyataan akhir yang tidak dapat diaudit.
Pengumuman awam Apodex menyatakan terdapat seruan terbuka untuk menghantar sistem penyelesai dan masalah saintifik.
Penghantaran penyelesai perlu mewakili sistem lengkap yang digunakan untuk menyiasat tugasan, bukan model asas sahaja. Ini termasuk lapisan penyelarasan, alatan, memori dan dasar kawalan.
Cadangan masalah pula perlu boleh diterjemahkan kepada persekitaran yang boleh laku dan boleh disahkan. Secara praktikal, ini bermakna peserta perlu menetapkan perkara yang boleh diperhatikan dan dilakukan oleh penyelesai, jenis maklum balas yang diterima, serta cara dakwaan pertengahan atau akhir disemak berdasarkan kriteria kejayaan yang jelas.
TRACES mengubah soalan penilaian AI daripada “Adakah AI memberikan jawapan yang dijangka?” kepada “Adakah AI menjalankan penyiasatan yang berdisiplin dan berasaskan bukti?”
Pendekatan itu lebih dekat dengan realiti penemuan saintifik berbanding ujian statik berasaskan kunci jawapan. Pada masa yang sama, ia turut menunjukkan batas penting: skor proses boleh memperbaik cara AI dinilai, tetapi tidak dengan sendirinya membuktikan bahawa penemuan yang dijana AI selamat, berguna atau sudah bersedia untuk digunakan.
Pertimbangan saintifik manusia kekal penting.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TRACES ialah penanda aras Apodex untuk AI penemuan terbuka, yang menilai cara sistem menyiasat masalah dan bukannya menyemak jawapan berdasarkan kunci jawapan tetap.
TRACES ialah penanda aras Apodex untuk AI penemuan terbuka, yang menilai cara sistem menyiasat masalah dan bukannya menyemak jawapan berdasarkan kunci jawapan tetap. Penilaian merangkumi enam keupayaan: Tools, Repair, Alternatives, Coherence, Evidence dan Scope.
Pasukan boleh menyertai dengan menghantar sistem penyelesai lengkap atau mencadangkan masalah saintifik yang boleh dijadikan persekitaran boleh laku dan boleh disahkan.