AMD julkaisi alustavat suorituskykymittaukset Muse Glimmer 30B:lle uusimmalla laitteistollaan. Testit suoritettiin Windowsissa käyttäen llama.cpp-projektia Vulkan-taustajärjestelmällä ja dFlash-spekulatiivisella dekoodauksella .
On tärkeää huomata, että nämä ovat AMD:n omia varhaisia, alustavia tuloksia, joten todellinen suorituskyky voi vaihdella järjestelmäkokoonpanon, jäähdytyksen ja työkuorman mukaan .
Malli käyttää 4 bitin kvantisointia (K-Quant-Dynamic) pienentääkseen muistijalanjälkensä yli 55 gigatavusta täydessä tarkkuudessa noin 18–20 gigatavuun . Tämä mahdollistaa mallipainojen, KV-välimuistin ja havainnointikooderin lataamisen samanaikaisesti yhdelle kuluttajatason näytönohjaimelle, jossa on 24 tai 32 gigatavua VRAM-muistia . Metan omien testien mukaan tämä kvantisointitaso aiheuttaa ”minimaalisen tai ei lainkaan heikkenemistä agenttitehtävissä” .
AMD ja sen kumppanit ovat varmistaneet useita välittömiä polkuja kehittäjille Muse Glimmer -mallin käyttöön ottamiseksi heti julkaisupäivästä lähtien.
LM Studio teki suoran yhteistyön Metan kanssa tarjotakseen tuen Muse Glimmerille heti julkaisupäivänä LM Studio Bionic -työpöytäsovelluksessaan . Käyttäjät voivat ladata ja suorittaa mallin paikallisesti muutamalla klikkauksella sovelluksen sisäisestä luettelosta. Pienin Muse Glimmer -versio vaatii vähintään 26 gigatavua RAM-muistia . LM Studio on saatavilla sekä Windowsille että Linuxille, se käyttää llama.cpp-ajoympäristöä ja on keskeinen työkalu AMD:n paikallisen tekoälyn ekosysteemissä .
AMD:n oma avoimen lähdekoodin paikallinen tekoälypalvelin Lemonade on asemoitu ensisijaiseksi integraatiopoluksi . Lemonade tarjoaa paikallisesti suoritettavat mallit alan standardin OpenAI-rajapinnan kautta, joten mikä tahansa olemassa oleva OpenAI-yhteensopiva sovellus voi toimia välittömästi paikallisen Muse Glimmer -instanssin kanssa . Se tukee tekstin, kuvan ja äänen tuottamista yhdessä kevyessä C++-paketissa, joka toimii Windowsissa, Linuxissa, macOS:ssä ja Dockerissa .
LM Studion ja Lemonaden lisäksi Muse Glimmerillä on laaja ekosysteemituki, joka on rullautumassa käyttöön julkaisun myötä:
meta-models/Muse-Glimmer-30B Apache 2.0 -lisenssillä .Tämä työkalujen laajuus tarkoittaa, että kehittäjät eivät ole sidottuja yhteen ajoympäristöön, vaan voivat valita tarpeisiinsa parhaiten sopivan pinon .
AMD kutsuu nimenomaisesti Muse Glimmerin ja sen laitteiston yhdistelmää ”Agentti-PC:n seuraavaksi vaiheeksi” . Strateginen argumentti on kolmiosainen:
Kun päättely suoritetaan kokonaan paikallisella laitteistolla, arkaluonteinen data – asiakirjat, koodi, henkilökohtaiset tiedot – ei koskaan poistu käyttäjän koneelta. Ei ole API-kutsuja kolmansien osapuolten palvelimille, pilvipalveluntarjoajat eivät kirjaa dataa, eikä verkkoyhteydestä olla riippuvaisia . Yrityskäyttöön liittyvissä luottamuksellisissa tiedoissa tämä on ratkaiseva etu.
Kun laitteisto on hankittu, paikallisella päättelyllä ei ole token-kohtaista kustannusta. Ei ole API-käyttömaksuja, ei tilausmaksuja päättelypäätepisteille eikä muuttuvia pilvilaskentakustannuksia . Kehittäjille, jotka ajavat jatkuvia agenttisilmukoita tai raskaita erätyökuormia, tämä muuttaa perustavanlaatuisesti tekoälyagenttien käyttöönoton taloutta.
Metan päätös julkaista Muse Glimmer sallivalla Apache 2.0 -lisenssillä on kriittinen osa tarjousta . Kehittäjät voivat täysin tarkastaa, muokata, hienosäätää ja levittää mallia ilman rajoituksia. Tämä poistaa toimittajariippuvuuden yksittäiseen mallitoimittajaan ja on linjassa AMD:n laajemman pyrkimyksen kanssa rakentaa avoin vaihtoehto Nvidian omalle CUDA-ekosysteemille .
Kuten AMD toteaa virallisessa blogissaan: ”Avoimien painojen mallien, kuten Muse Glimmerin, ja tehokkaan paikallisen laitteiston yhdistelmä pitää kaiken päättelyn yksityisenä, vähäviiveisenä ja riippumattomana pilvi-API-kustannuksista tai -yhteydestä” .
Vaikka ilmoitus on merkittävä, muutama varoitus on syytä ottaa huomioon:
AMD:n vahvistus tuesta Metan Muse Glimmer 30B:lle on merkittävä virstanpylväs paikallisen tekoälyn ekosysteemille. Se osoittaa, että suorituskykyinen 30 miljardin parametrin agenttimalli voi toimia yhdellä kuluttajatason näytönohjaimella, tarjoaa kehittäjille kypsän avointen painojen vaihtoehdon Apache 2.0 -lisenssillä ja tarjoaa selkeät, välittömät integraatiopolut LM Studion ja Lemonaden kautta. Ilmoitus vahvistaa ”Agentti-PC:n” tapausta – tulevaisuutta, jossa tehokkaat tekoälyagentit toimivat yksityisesti, jatkuvasti ja kustannustehokkaasti laitteistolla, jonka käyttäjät jo omistavat .