DeepSeek V4 Flash mendahului carta penggunaan mingguan OpenRouter bagi 27 Julai hingga 2 Ogos dengan 7.22 trilion token, namun tempoh itu turut meliputi laluan pratonton yang wujud sebelum keluaran 31 Julai. Di OpenRouter, laluan bertarikh V4 Flash 0731 disenaraikan pada AS$0.05 bagi sejuta token input dan AS$0.16 b...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 menjadi contoh jelas betapa pantas pilihan model lalai boleh berubah apabila harga token rendah, kapasiti konteks besar dan akses mudah melalui agregator tersedia pada masa yang sama. Model ini dilaporkan menduduki tempat pertama carta penggunaan mingguan OpenRouter bagi 27 Julai hingga 2 Ogos, dengan 7.22 trilion token diproses. Namun, angka besar itu perlu dibaca dengan berhati-hati. 5
Keluaran 31 Julai ialah model mixture-of-experts (MoE) jarang, dengan 284 bilion parameter keseluruhan tetapi hanya 13 bilion parameter aktif bagi setiap token. OpenRouter menyenaraikan tetingkap konteks 1,310,720 token dan meletakkan model ini untuk kerja pengekodan, penaakulan serta aliran kerja ejen AI. 1
Gabungan ini menarik bagi tugasan yang menggunakan banyak token:
Seni bina MoE sahaja tidak membuktikan kos sebenar lebih rendah atau mutu jawapan lebih baik. Kepentingannya lebih kepada ekonomi pengkomputeran: hanya sebahagian parameter diaktifkan untuk setiap token, dengan tujuan menyediakan kapasiti model besar tanpa corak pengiraan per token seperti model padat yang sama saiz keseluruhannya. Sama ada manfaat itu benar-benar dirasai aplikasi bergantung pada kependaman, kapasiti penyedia, penghalaan, reka bentuk arahan dan panjang output.
TechNode melaporkan DeepSeek V4 Flash memproses 7.22 trilion token di OpenRouter sepanjang 27 Julai hingga 2 Ogos. Laporan sama menyatakan model dari China mengisi empat kedudukan teratas, manakala DeepSeek V4 Flash 0731 dan V4 Pro turut berada dalam enam teratas. 5
Namun, minggu yang dilaporkan bermula sebelum keluaran beta awam pada 31 Julai. V4 Flash sudah tersedia sebagai laluan pratonton, manakala keluaran 0731 menggantikan pratonton itu pada titik akhir API deepseek-v4-flash. 3 Oleh itu, jumlah mingguan tersebut tidak wajar dianggap sebagai penggunaan yang dijana sepenuhnya oleh versi baharu.
Akses percuma juga nampaknya faktor penting. Laporan sama menyebut OpenCode memproses 8 trilion token untuk model berkenaan pada 1 Ogos, termasuk 5 trilion token melalui percubaan percuma dan 3 trilion token yang dibayar pembangun. 5 Trafik percubaan penting secara strategik kerana ia membolehkan pembangun mencuba model dengan halangan rendah, tetapi ia berbeza daripada permintaan pengeluaran berbayar yang berterusan.
Kesimpulan yang lebih kukuh ialah V4-Flash mendapat pengedaran dan eksperimen yang sangat pantas. Bukti sedia ada belum membuktikan bahawa semua volum awal itu datang daripada perpindahan pelanggan berbayar atau penggunaan produksi yang kekal.
Harga boleh berubah mengikut penyedia, laluan, diskaun, status cache dan tarikh. Harga API rasmi yang disebut dalam liputan keluaran 31 Julai ialah AS$0.14 bagi sejuta token input tanpa cache dan AS$0.28 bagi sejuta token output, manakala OpenRouter menyenaraikan kadar peringkat laluan yang berbeza pada awal Ogos. 3
Senarai OpenRouter yang lebih kemudian bagi laluan bertarikh deepseek-v4-flash-0731 menunjukkan AS$0.05 bagi sejuta token input, AS$0.16 bagi sejuta token output dan AS$0.013 bagi sejuta token bacaan cache. 1
Berdasarkan kadar OpenRouter itu, jurangnya berbanding harga yang dibekalkan bagi model lain adalah besar:
| Model | Harga input / output tersenarai bagi 1 juta token | Berbanding V4-Flash pada AS$0.05 / AS$0.16 |
|---|---|---|
| DeepSeek V4-Flash-0731 | AS$0.05 / AS$0.16 |
Asas |
| Kimi K3 | AS$3 / AS$15 |
Kira-kira 60× / 94× lebih tinggi |
| GPT-5.6 Sol | AS$5 / AS$30 |
Kira-kira 100× / 188× lebih tinggi |
| Claude Fable 5 | AS$10 / AS$50 |
Kira-kira 200× / 313× lebih tinggi |
Ini ialah perbandingan aritmetik harga senarai, bukannya bukti bahawa semua model memberikan mutu, kelajuan, kebolehpercayaan penggunaan alat, ciri keselamatan atau masa operasi yang setara. Ia juga bukan ukuran sejagat bagi “kos setiap tugasan”. Bil sebenar bergantung pada panjang input dan output, penggunaan cache, percubaan semula, panggilan alat, penyedia dipilih serta kekerapan aliran kerja perlu dinaik taraf kepada model lain.
Kimi K3, GPT-5.6 Sol dan Claude Fable 5 tidak patut dianggap saling boleh ganti hanya kerana semuanya menyasarkan kes penggunaan pengekodan lanjutan dan ejen AI. Sumber perbandingan yang dibekalkan menggambarkan Kimi K3 sebagai model MoE dengan 2.8 trilion parameter dan konteks 1 juta token; ia turut menyenaraikan konteks 1.05 juta token untuk GPT-5.6 Sol serta 1 juta token untuk Claude Fable 5. 17
Bagi pembeli, perbezaan yang lebih berguna ialah dari sudut operasi:
Penanda aras awam boleh membantu membina senarai pendek, tetapi satu skor tidak boleh menentukan model lalai untuk penggunaan produksi. Perbandingan “Agent Ultimate” 25.2 berbanding 25.7 yang disebut dalam dakwaan asal tidak disokong secara bebas oleh sumber utama yang dibekalkan, maka ia tidak patut digunakan sebagai bukti bahawa model-model itu hampir setara. Bahan keluaran DeepSeek sendiri melaporkan skor seperti 82.7 pada Terminal Bench 2.1 dan 54.2 pada NL2Repo, namun keputusan penanda aras tetap perlu disahkan untuk beban kerja khusus. 10
Bagi pasukan pembangunan bersaiz sederhana, keputusan jarang sekali berbunyi “model manakah menang papan pendahulu?” Sebaliknya, persoalannya ialah: model manakah cukup andal untuk tugasan sebenar kami, dan cukup murah untuk menjimatkan kos selepas mengambil kira kos penghalaan serta kegagalan?
Penilaian yang praktikal boleh dibuat seperti berikut:
Inilah sebabnya kenaikan V4-Flash penting walaupun angka token awal mungkin dinaikkan oleh percubaan. Ia menunjukkan bagaimana agregator model seperti OpenRouter membolehkan pembangun mencuba pilihan berkonteks besar dan sangat murah dengan segera. Jika pilihan itu cukup baik dalam penilaian produksi, ia berpotensi mengalihkan kerja rutin daripada model lalai yang lebih mahal.
Bukti yang dibekalkan menyokong kedudukan mingguan OpenRouter pada 7.22 trilion token, pertindihan tempoh dengan laluan pratonton terdahulu, serta komponen percubaan percuma yang dilaporkan di OpenCode. 3
5 Namun, ia tidak cukup menyokong dakwaan bahawa model China menguasai sembilan daripada 10 tempat teratas, melepasi volum panggilan AS selama 14 minggu berturut-turut, mencetuskan perpindahan besar-besaran pembangun AS dan Eropah, menghasilkan pengurangan kos inferens sebenar 60–85%, atau memaksa potongan harga 80% yang khusus oleh GPT-5.6 Luna.
Dakwaan tersebut memerlukan data papan pemuka OpenRouter secara langsung, rekod harga penyedia atau kajian beban kerja yang boleh dihasilkan semula. Buat masa ini, rumusan berasaskan bukti lebih terbatas: DeepSeek V4-Flash menggabungkan harga laluan yang amat rendah, tetingkap konteks besar dan akses meluas ketika pembangun sedang bersedia menguji model ejen dan pengekodan yang lebih murah. Itu sudah memadai untuk mencetuskan lonjakan penggunaan pantas—tetapi belum cukup untuk membuktikan perubahan pasaran yang kekal.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash mendahului carta penggunaan mingguan OpenRouter bagi 27 Julai hingga 2 Ogos dengan 7.22 trilion token, namun tempoh itu turut meliputi laluan pratonton yang wujud sebelum keluaran 31 Julai.
DeepSeek V4 Flash mendahului carta penggunaan mingguan OpenRouter bagi 27 Julai hingga 2 Ogos dengan 7.22 trilion token, namun tempoh itu turut meliputi laluan pratonton yang wujud sebelum keluaran 31 Julai. Di OpenRouter, laluan bertarikh V4 Flash 0731 disenaraikan pada AS$0.05 bagi sejuta token input dan AS$0.16 bagi sejuta token output, dengan tetingkap konteks 1,310,720 token.
Trafik percubaan percuma ialah peringatan penting: OpenCode dilaporkan memproses 8 trilion token untuk model itu pada 1 Ogos, termasuk 5 trilion melalui percubaan percuma.