Kuvia voi toimittaa DeepSeekin ohjeiden mukaan esimerkiksi suoraan pyynnön mukana, ulkoisena URL-osoitteena tai Files API:n kautta. Responses API:n dokumentaatio kuvaa erikseen kuvien välittämisen tällä mallilla.
Tämä tekee julkaisusta kiinnostavan agenttien rakentajille. Agentti voi tulkita kuvakaappauksen, kaavion, skannatun dokumentin tai verkkosivun visuaalisen sisällön ennen seuraavan työkalukutsun valintaa. DeepSeek dokumentoi myös Codex-integraation, jossa Vision Exp on vaihtoehto kuvasyötteen lisäämiseksi.
DeepSeekin julkaisutietojen mukaan DeepSeek Harness 0.1.1 sai tuen mallille, mikä tarjoaa uuden reitin agenttityönkulkuihin. GitHub Copilotia koskevissa DeepSeekin ohjeissa mallivalitsimessa mainitaan kuitenkin V4 Pro ja V4 Flash. Kuvien käsittely kuvataan toisen asennetun Copilot-mallin kautta, joten ohjeet eivät vahvista Vision Expin suoraa saatavuutta kyseisessä valitsimessa.
DeepSeekin keskeinen väite on, että Vision Exp säilyttää V4-Flashin tekstisuorituskyvyn ja ottaa suuren harppauksen multimodaalisissa agenttitesteissä. Yhtiön mukaan sen suorituskyky on näissä tehtävissä lähellä Claude Opus 4.8:aa.
Joissakin julkaisuissa on toistettu yksittäisiä testilukuja: Chartography 64,3, ApexBench Pass@1 36,5, Agents’ Last Exam 27,3 ja ZeroBench Pass@5 35,0. Luvut perustuvat DeepSeekin ilmoitusta käsittelevään toissijaiseen uutisointiin, eivät yksityiskohtaiseen ja itsenäisesti toistettavissa olevaan eri valmistajien vertailuun.
Ero on tärkeä. Ilmaus ”lähellä Opus 4.8:aa” ei tarkoita, että malli päihittäisi Clauden yleisesti, vastaisi sitä kaikissa tehtävissä tai olisi tuotannossa yhtä luotettava. Käytettävissä olevat lähteet eivät tarjoa puolueetonta testiä, jossa DeepSeekia ja Anthropicia verrattaisiin samoilla syötteillä, työkaluympäristöillä, viiveillä, virhemäärillä ja kustannuksilla.
Varovaisin ja perustelluin johtopäätös on tämä: DeepSeek on julkaissut todellisen, dokumentoidun kuvasyötettä tukevan API-mallin, ja sen omat tulokset viittaavat merkittävään parannukseen V4-Flashiin verrattuna tehtävissä, joissa visuaalisella tiedolla on merkitystä. Mallin asemaa Claudeen, OpenAI:n, Googlen tai muiden kiinalaisten tekoälymallien rinnalla ei ole vielä vahvistettu.
Saatavilla olevien mallilistauksien mukaan Vision Exp maksaa 0,22 dollaria miljoonalta syötetokenilta ja 0,66 dollaria miljoonalta tulostetokenilta. Konteksti-ikkunan pituus on miljoona tokenia. DeepSeekin virallinen hinnoitteludokumentaatio vahvistaa, että API-hinnat ilmoitetaan miljoonaa tokenia kohti ja että
deepseek-v4-flash-vision-exp kuuluu mallitaulukkoon.
Kuvat muunnetaan API-laskutuksessa tokeneiksi. DeepSeekin julkaistuun ohjeistukseen viittaavan raportin mukaan yksi kuva voi muodostaa enintään 384 tokenia, ja mallissa käytetään V4-Flashin hinnoittelurakennetta. Visuaalisen työnkulun todellinen hinta riippuu siis kuvien määrästä ja koosta, ympäröivän tekstin määrästä, vastauksen pituudesta sekä toistuvasta kontekstista.
Anthropic ilmoittaa Claude Opus 4.8:n hinnaksi 5 dollaria miljoonalta tavalliselta syötetokenilta ja 25 dollaria miljoonalta tulostokenilta. Lisäksi Anthropicilla on erilliset hinnat välimuistille ja Fast-tilalle.
Token-hintojen perusteella DeepSeek on huomattavasti edullisempi. Se on hyvä syy kokeilla mallia, mutta pelkkä hinnasto ei kerro työnkulun kokonaiskustannuksia. Halvempi malli ei välttämättä ole kokonaisuutena edullisempi, jos se tarvitsee enemmän uusintayrityksiä, tekee enemmän työkalukutsujen virheitä tai vaatii ylimääräistä kuvien esikäsittelyä.
Mallit ovat osin päällekkäisistä käyttötapauksista huolimatta eri asemassa:
DeepSeekin strateginen viesti on siksi selkeä: se tuo näkökyvyn edullisempaan Flash-malliluokkaan ja väittää suorituskyvyn olevan multimodaalisissa agenttitehtävissä lähellä premium-luokan mallia. Käytettävissä oleva näyttö ei todista Claudea paremmaksi kaikissa testeissä. Sen etu tässä vertailussa on pikemminkin dokumentoitu kypsyys, laajempi tuotevalikoima ja työkalujen vakiintuneempi asema.
Vertailu kannattaa tehdä tehtäväkohtaisesti. Kuvakaappausten lukemiseen tai kaavioiden poimintaan Vision Exp voi tarjota riittävän laadun paljon pienemmällä tokenikustannuksella. Kriittisessä autonomisessa työnkulussa olennaisempia kysymyksiä ovat kuitenkin johdonmukaisuus, työkalujen käytön tarkkuus, kieltäytymiskäyttäytyminen, valvottavuus, tuki ja virheistä palautuminen.
Julkaisu on merkittävä ennen kaikkea siksi, että näkökyvystä on tulossa osa agenttityötä, ei vain erillinen kuvakysymysten ominaisuus. Koodausagenttien pitää ehkä lukea kuvakaappauksia, selainagenttien tulkita verkkosivuja ja yritysjärjestelmien yhdistää dokumentteja, kaavioita ja rakenteisia työkalukutsuja.
DeepSeekin V4-perhe on jo painottanut pitkää kontekstia ja agenttityönkulkuja. Yhtiön V4-dokumentaatiossa Flash kuvataan perheen nopeammaksi ja taloudellisemmaksi vaihtoehdoksi. Vision Exp jatkaa tätä linjaa multimodaalisiin agentteihin sen sijaan, että kyseessä olisi erillinen vain kuvia käsittelevä malli.
Näyttö ei silti riitä julistamaan DeepSeekia Anthropicia, OpenAI:ta, Googlea tai johtavia kiinalaisia tutkimuslaboratorioita edelläkävijäksi. Saatavilla olevissa lähteissä ei ole riippumatonta ja täysin vertailukelpoista eri valmistajien testiä, eikä kokeellinen API-julkaisu vastaa kypsyydeltään vakiintunutta lippulaivamallia.
Kyllä, kunhan kokeilu tehdään hallitusti.
Hyvä testi vertaa Vision Expia Claude Opus 4.8:aan ja nykyiseen tuotantomalliin samoissa kuvia ja työkaluja yhdistävissä tehtävissä. Seurattavia mittareita ovat esimerkiksi:
Toistaiseksi oikea tuomio on varovaisen myönteinen: DeepSeek V4 Flash Vision Exp on uskottava uusi multimodaalinen API-kokeilu, jonka ilmoitettu hinta ja kehittäjärajapinnat ovat houkuttelevia. Väite Claude Opus 4.8:n tasoa lähestyvästä multimodaalisesta agenttisuorituskyvystä kannattaa testata – ei vielä hyväksyä itsenäisesti vahvistettuna faktana.