Videon luonti. FLUX 3 voi tuottaa yhdellä kertaa enintään 20 sekunnin videoleikkeitä, joihin syntyy myös luonnollinen, synkronoitu ääni . Malli tukee tekstistä videoksi -luontia, kuvasta videoksi -muunnoksia, videon muokkaamista videon pohjalta, avainruuduista videoksi -työskentelyä sekä useiden leikkeiden ketjuttamista agenttimaisessa työnkulussa . Tuotokset voivat olla 1080p-tarkkuudella ja 24 kuvan sekuntinopeudella, ja niissä luvataan usean otoksen jatkuvuutta sekä kameran hallintaa .
Äänen luonti. Ääni tuotetaan videon rinnalla, ei erillisenä jälkikäsittelyvaiheena. Ominaisuuksiin kuuluvat monikielinen puhe ja äänitehosteet, jotka liittyvät visuaalisiin tapahtumiin . Äänilähtö on 48 kHz:n stereoääntä .
Kuvien luonti ja muokkaus. Malli on suunniteltu tuottamaan ja editoimaan kuvia eri tyyleillä, kuvasuhteilla ja tarkkuuksilla. BFL nostaa esiin myös tekstin paremman toiston ja monimutkaisten kehotteiden käsittelyn . Kuvageneroinnin ennakkokäytön oli määrä alkaa "tulevina viikkoina" julkaisun jälkeen .
Toiminnan ennustaminen. FLUX 3:n maailmamallia voidaan käyttää robottien toimintojen ennustamiseen joko suoraan tai hienosäädetyn toiminnan purkajan avulla . Tämä tekee samasta perustasta mahdollisen sekä luovalle sisällöntuotannolle että fyysisten robottien ohjaamiseen .
FLUX 3 perustuu BFL:n Self-Flow-lähestymistapaan, jonka tarkoituksena on sovittaa multimodaalinen tuottaminen ja ymmärtäminen samaan viitekehykseen . Käytännössä malli ei käsittele kuvaa, ääntä ja videota täysin erillisinä saarekkeina, vaan pyrkii rakentamaan niistä yhteisen maailmanesityksen.
BFL:n FLUX-mimic-julkaisun mukaan toiminnan ennustamisen lisääminen heikensi videon laatua koulutuksen aikana hetkellisesti enimmillään 10 prosenttia. Malli palautti kuitenkin täyden videolaadun noin 3 500 koulutusaskeleen jälkeen ja säilytti samalla toiminnan ennustamisen kyvyn .
Black Forest Labs kehitti sveitsiläisen mimic robotics -startupin kanssa FLUX-mimic-mallin, joka rakentuu FLUX 3:n päälle . Järjestelmä kouluttaa kevyen toiminnan purkajan FLUX 3:n videon ennustuspolun väliominaisuuksista. Näin robotti voi tulkita fyysisiä toimintoja mallin oppimasta maailmanesityksestä .
FLUX-mimic-mallia on testattu ja otettu käyttöön Audin todellisissa tuotantotehtävissä . Kumppaneiden mukaan robotit ovat pystyneet ratkaisemaan monimutkaisia pehmeiden materiaalien käsittelytehtäviä, joita olisi ollut perinteisellä ohjelmoinnilla mahdotonta toteuttaa . Järjestelmän kerrotaan myös tarvitsevan uusien tehtävien oppimiseen vähemmän esimerkkidataa kuin aiemmat lähestymistavat .
Yhteistyössä BFL tuo pöytään visuaalisen perusmallin, kun taas mimic robotics vastaa robottioppimisesta, vaativasta käsittelystä ja käyttöönotosta tuotantoympäristössä .
Yhteisöfoorumeilla esiin nousseita lukuja – alle 80 millisekunnin päättelyaikaa yhdellä RTX 5090 -näytönohjaimella ja 101 millisekunnin järjestelmäreaktioaikaa – ei löydy BFL:n, Bloombergin tai julkaisupäivän virallisten tiedotteiden käytettävissä olevista lähteistä . Myöskään BFL:n omissa FLUX 3 -julkaisuissa ei ilmoiteta näitä laitekohtaisia suorituskykylukuja .
Luvut voivat perustua julkaisemattomaan tekniseen raporttiin, ulkopuoliseen analyysiin tai myöhempiin testeihin, mutta nykyisen lähdeaineiston perusteella niitä ei voi vahvistaa. FLUX 3:n kokonaisuus on suunniteltu lähes reaaliaikaiseen robottien ohjaukseen, mutta BFL ei ole julkaissut kuluttajatason näytönohjaimille virallista viivemääritystä.
Vertailun vuoksi aiemman FLUX.1-mallin on raportoitu tuottavan 1 024 × 1 024 pikselin kuvan RTX 5090:llä noin 5–12 sekunnissa optimoinneista riippuen. Myös FLUX.2-devin yhteisötesteissä ajat ovat olleet kuvakohtaisesti sekuntien luokkaa . Videon ja robottien toiminnan ennustamisen työkuormat ovat kuitenkin olennaisesti erilaisia, joten kuvageneroinnin ajat eivät suoraan kerro FLUX 3:n robottiviiveestä.
Varhaiskäyttöä voi hakea BFL:n FLUX 3 -mallisivun lomakkeella osoitteessa bfl.ai/models/flux-3 .