Opdateringen kombinerer visuel forståelse med programmering og skal gøre AI agenter bedre til at efterprøve kilder og data. ByteDance viser blandt andet en mobilgrænseflade bygget ud fra skitser og en skærmoptagelse samt fejlrettelser i Luanti, hvor 83 % af opgaverne ifølge selskabet opfyldte dets kriterium for at k...
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did ByteDance’s September 16, 2026 release of Doubao Seed 2.1 pro 0915 on Volcengine’s Volcano Ark APIs add to multimodal coding, agent. Article summary: ByteDance’s September 16 update made Doubao Seed 2.1 pro 0915 available through Volcano Ark and emphasized production tasks that combine visual input, code, tools, and long running agents.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbn
ByteDance gjorde den 16. september 2026 version 0915 af Doubao-Seed-2.1-pro tilgængelig via API’erne på selskabets Volcengine-platform, Volcano Ark. Opdateringen retter sig mod opgaver, hvor en AI-model skal kombinere billeder eller video med kode, informationssøgning og brug af værktøjer. Volcengines modeloversigt angiver, at den daterede API-model doubao-seed-2-1-pro-260915 understøtter multimodal forståelse og værktøjskald. 3
18
Den mest håndgribelige demonstration begyndte med et ældre, udokumenteret ERP-system – software til at styre virksomhedens centrale arbejdsgange – med omkring 280.000 linjer Java-kode. Ifølge omtalen brugte modellen en optagelse af, hvordan systemet blev betjent, og nogle håndtegnede skitser til at udvikle en fungerende mobilgrænseflade. Opgaven var dermed ikke blot at omsætte en skriftlig specifikation til kode, men også at udlede brugergrænsefladens funktion af visuelt materiale og eksisterende kode. 2
7
ByteDance fremhæver også bedre forståelse af store kodeprojekter og fejl, der går på tværs af filer. I open source-spilprojektet Luanti, med cirka 387.000 linjer kode, arbejdede flere underagenter i knap 36 timer med 1.000 historiske fejlrapporter. Ifølge ByteDance nåede 83 % af opgaverne selskabets standard for en rettelse, der kunne sammenflettes med projektets kode. Det er et mål for mulige rettelser i denne test – ikke dokumentation for, at 83 % faktisk blev accepteret af projektet, vedligeholdt eller viste sig fri for følgefejl. 2
7
En tredje demonstration tog udgangspunkt i fire billeder af en gårdhave i forskellige årstider. Her genererede modellen kode til en interaktiv 3D-genskabelse. Eksemplet illustrerer den tilsigtede kobling mellem billedforståelse og programmering, men er stadig en demonstration frem for en uafhængig kvalitetstest. 2
6
Opdateringen beskrives også som bedre til at finde belæg i video på tværs af billeder, genkende blandt andet CAD-dele og læse tæt pakkede faglige dokumenter som tekniske tegninger og tabeller i regnskaber. For længere agentopgaver lægges der vægt på kildeopsporing, kontrol af oplysningers aktualitet og krydstjek af data. I en omtalt researchdemonstration brugte modellen mere end 500 underagenter og søgte på over 1.000 websider; det viser omfanget af forsøget, ikke i sig selv at konklusionerne var korrekte. 2
4
7
15
Ifølge Volcengine kræver billed- og videoræsonnement over 30 % færre tokens end i den foregående version, samtidig med at antallet af ræsonnementsrunder og værktøjskald er reduceret. Tokens er de enheder, API-forbrug typisk opgøres i. Besparelsen gælder det rapporterede tokenforbrug i disse opgavetyper; den garanterer ikke en tilsvarende reduktion af en kundes samlede faktura. Tidligere benchmarkresultater for 2.1 Pro kan heller ikke bruges som en måling af, hvor meget netop 0915-versionen er forbedret. 6
7
11
Versionen kan vælges i Doubao Work og er integreret i programmeringsproduktet TRAE. Den løbende opdaterede Doubao-Seed-Evolving-adgang fik ifølge omtalen samme version, uden at eksisterende virksomhedskunder skulle skifte API-endpoint. Til reproducerbare forsøg bør et team derfor kontrollere, hvilken dateret modelversion dets kald faktisk rammer. 3
10
18
Før resultaterne bruges som grundlag for indkøb eller drift, bør et eksternt team bede om Luanti-opgavelisten, rettelserne, testene, bedømmelseskriterierne og det anvendte budget for agenter og værktøjer. Derefter bør det afprøve egne kode-, dokument- og billedopgaver på en fastlåst modelversion og måle korrekthed, sikkerhed, menneskelig gennemgangstid, svartid, værktøjskald og faktisk faktureret pris mod den løsning, det allerede bruger. De tilgængelige beskrivelser dokumenterer ikke en uafhængig gentagelse af hoveddemonstrationerne. 2
3
7
11
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Opdateringen kombinerer visuel forståelse med programmering og skal gøre AI agenter bedre til at efterprøve kilder og data.
Opdateringen kombinerer visuel forståelse med programmering og skal gøre AI agenter bedre til at efterprøve kilder og data. ByteDance viser blandt andet en mobilgrænseflade bygget ud fra skitser og en skærmoptagelse samt fejlrettelser i Luanti, hvor 83 % af opgaverne ifølge selskabet opfyldte dets kriterium for at kunne sammenflettes med p...
Påstanden om over 30 % færre tokens til billed og videoræsonnement er ikke det samme som 30 % lavere samlet regning.