Multimodaliti natif ialah taruhan produk untuk ejen visual: Kimi K3 dan Qwen3.8 Max menyepadukan penglihatan dengan penaakulan jangka panjang supaya ejen boleh membina, merender, memeriksa dan membaiki hasil dalam sat... Kimi K3 mencatat 1,679 mata dan tempat pertama dalam Frontend Code Arena Arena, manakala Qwen3.8...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Jurang yang semakin ketara antara model AI barisan hadapan bukan sekadar sama ada sesuatu sistem boleh menerima imej. Isu yang lebih penting ialah sama ada bukti visual dianggap sebagai bahagian teras dalam kitaran penaakulan ejen.
Kimi K3 daripada Moonshot AI diposisikan sebagai model ejen multimodal natif untuk pengekodan jangka panjang, kerja berasaskan pengetahuan, kefahaman visual dan penaakulan. Alibaba pula menyatakan bahawa kefahaman visual Qwen3.8-Max digunakan merentasi perancangan, pelaksanaan dan pengesahan. 17
35 Matlamat praktikalnya mudah: ejen boleh membina sesuatu, melihat hasil yang dirender, mengenal pasti perkara yang tidak kena, kemudian membaikinya—tanpa perlu menukarkan setiap pemerhatian visual kepada laporan teks perantaraan.
Model umum yang berasaskan teks masih sangat berguna untuk menjana kod, menganalisis konteks panjang, memanggil alat dan menyelesaikan tugas yang input serta kriteria kejayaannya memang sudah dinyatakan dalam teks. Dalam susun atur berasaskan alat, ejen boleh memanggil OCR, menyemak DOM atau pepohon kebolehcapaian, meminta koordinat elemen, atau menghantar tangkap layar kepada model bahasa-visual yang berasingan. Pendekatan ini boleh menjadi pilihan munasabah untuk pengekstrakan dokumen, pemeriksaan UI berstruktur atau soalan visual sekali sahaja.
Latihan multimodal natif membuat pertaruhan yang berbeza. Ia cuba mengendalikan teks, imej, video, kod dan keadaan ejen secara bersama supaya maklumat visual boleh mempengaruhi perancangan serta semakan terus. Laporan mengenai pasaran model China menggambarkan Moonshot, Alibaba dan ByteDance sebagai menghala ke arah ini, manakala keluaran model umum DeepSeek, Zhipu dan Hunyuan lebih tertumpu pada teks pada ketika itu. 15
Namun, gambaran itu tidak wajar dianggap sebagai pemisahan kekal antara syarikat. DeepSeek V4 Flash dan V4 Pro pada asalnya hanya menyokong teks, tetapi DeepSeek kemudiannya memperkenalkan model eksperimen DeepSeek-V4-Flash-Vision-Exp. 13
4 Barisan model berubah pantas, dan sumber yang tersedia tidak membuktikan alasan dalaman yang muktamad bagi setiap makmal—terutamanya ByteDance, Zhipu dan Tencent.
Halaman web bukan hanya terdiri daripada perkataan dan struktur DOM. Ia juga melibatkan hierarki, ruang putih, penjajaran, kontras, tipografi, elemen terpotong, imejan dan hubungan antara komponen. Jika ejen diminta meniru reka bentuk rujukan, butiran inilah yang sering menjadi syarat penerimaan sebenar.
Aliran kerja penglihatan-dalam-gelung boleh berjalan seperti berikut:
Qwen3.8-Max secara jelas menerangkan model gelung tertutup ini: kefahaman visual natif digunakan sepanjang perancangan, pelaksanaan dan pengesahan bagi kerja jangka panjang. Model hosnya menyokong input imej, teks dan video, dengan output teks. 35 Kimi K3 juga menyokong kefahaman teks, imej dan video dalam satu model, serta tetingkap konteks 1 juta token.
25
Kelebihannya bukan semata-mata “model boleh melihat”. Yang penting, ejen yang sama boleh mengekalkan arahan, kod, output visual dan pelan yang sentiasa berkembang dalam konteks yang sama ketika melakukan iterasi.
Alat persepsi luaran sering berkesan, tetapi ia mewujudkan sempadan antara proses melihat dan bertindak.
OCR bersifat terpilih. Ia boleh mengekstrak perkataan yang kelihatan, tetapi teks semata-mata tidak cukup untuk menerangkan sama ada butang dipotong, susun atur tidak seimbang, tetingkap modal menutupi kandungan, atau hierarki visual berbeza daripada rujukan.
Koordinat tersusun tetapi sempit skopnya. Laporan seperti “elemen pada x/y” berguna untuk automasi, tetapi mungkin tidak menyampaikan kepentingan visual, gaya, pertindihan, atau sama ada elemen itu benar-benar objek yang betul dari sudut paparan.
Terjemahan berulang boleh menyukarkan rantaian kerja panjang. Dalam aliran berbilang langkah, setiap serahan daripada tangkap layar kepada huraian atau koordinat boleh menghilangkan konteks, atau memaksa ejen membinanya semula. Tampalan berdasarkan huraian tidak lengkap boleh mencetuskan masalah visual lain, lalu memerlukan satu lagi kitaran pemerhatian.
Model multimodal natif tidak menghapuskan kesilapan, tetapi ia boleh menaakul menggunakan tangkap layar dan konteks pelaksanaan secara serentak, bukan bergantung sepenuhnya pada ringkasan teks tentang kandungan tangkap layar. Itulah daya tarikannya untuk pembangunan bahagian hadapan, automasi GUI, penyahpepijatan regresi visual, penyuntingan imej dan aliran kerja video.
Keputusan umum Kimi K3 membantu menjelaskan mengapa pembangun memberi perhatian. Arena melaporkan Kimi K3 berada di tempat teratas Frontend Code Arena dengan 1,679 mata, meningkat 17 kedudukan daripada Kimi K2.6; ia menduduki tempat pertama dalam enam daripada tujuh domain bahagian hadapan yang disenaraikan. 32 Secara berasingan, laporan mengenai ujian Puter menyatakan bahawa Kimi K3 mengesan lima percanggahan visual yang sengaja dimasukkan antara halaman web sasaran dan versi yang dirender, tanpa positif palsu.
28
Ini ialah demonstrasi yang bermakna bagi pengesahan visual. Namun, kedua-duanya tidak membuktikan bahawa penglihatan natif sahaja menyebabkan keputusan tersebut. Skala model, data latihan, pascalatihan, reka bentuk arahan, alat pelayar, rangka kerja ejen dan reka bentuk penanda aras semuanya boleh mempengaruhi prestasi. Kesimpulan yang lebih berhati-hati ialah maklum balas visual menangani kelas kegagalan sebenar yang boleh terlepas daripada ujian berasaskan teks sahaja.
Pilih ejen multimodal natif apabila tugasan memerlukan pemerhatian dan pembaikan berulang, serta ketepatan visual ialah sebahagian daripada definisi siap:
Saluran modular berasaskan OCR atau VLM luaran masih boleh menjadi pilihan lebih baik untuk pengekstrakan kos rendah, pemprosesan kelompok, atau aliran kerja yang hanya memerlukan teks berstruktur dan keadaan UI. Soalan utama bukan sama ada penglihatan sedang menjadi trend. Soalannya ialah sama ada ejen perlu menjawab soalan visual ini berulang kali: adakah output ini benar-benar kelihatan betul?
Bagi kategori kerja tersebut, multimodaliti natif menjadikan persepsi bukan panggilan alat sekali-sekala, sebaliknya sebahagian daripada gelung operasi ejen—arah yang sedang dikejar secara jelas oleh Kimi K3 dan Qwen3.8-Max. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Multimodaliti natif ialah taruhan produk untuk ejen visual: Kimi K3 dan Qwen3.8 Max menyepadukan penglihatan dengan penaakulan jangka panjang supaya ejen boleh membina, merender, memeriksa dan membaiki hasil dalam sat...
Multimodaliti natif ialah taruhan produk untuk ejen visual: Kimi K3 dan Qwen3.8 Max menyepadukan penglihatan dengan penaakulan jangka panjang supaya ejen boleh membina, merender, memeriksa dan membaiki hasil dalam sat... Kimi K3 mencatat 1,679 mata dan tempat pertama dalam Frontend Code Arena Arena, manakala Qwen3.8 Max menyatakan kefahaman visual digunakan sepanjang perancangan, pelaksanaan dan pengesahan.