A Apple realizou reuniões com a PrismML para avaliar o uso da tecnologia da startup que permite rodar modelos de IA muito maiores diretamente no iPhone, segundo o The Information [1][2][3]. A PrismML conseguiu comprimir o Qwen 3.6, um modelo denso de 27 bilhões de parâmetros da Alibaba, para rodar por completo em um...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Search & fact check with cited sources for What is the significance of Apple's reported discussions with PrismML regarding on device AI tech. Article summary: Significance of Apple's Discussions with PrismML Apple has held meetings with PrismML about using the startup's technology to run much larger AI models directly on iPhones, according to reporting from The Information [1]. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
A Apple realizou reuniões com a PrismML para avaliar o uso da tecnologia da startup que permite rodar modelos de IA muito maiores diretamente no iPhone, de acordo com uma reportagem do The Information . A PrismML demonstrou ser capaz de comprimir o Qwen 3.6, um modelo denso de 27 bilhões de parâmetros da Alibaba, para rodar por completo em um iPhone 17 Pro — estabelecendo um recorde para o maior modelo de IA já executado em um dispositivo móvel
.
Isso é um divisor de águas porque a Apple enfrenta uma limitação importante: seus próprios modelos de IA no dispositivo usam arquiteturas esparsas, onde apenas uma fração dos parâmetros é ativada a cada momento. Na WWDC 2026, a Apple anunciou um modelo no dispositivo de aproximadamente 20 bilhões de parâmetros, mas apenas 1 a 4 bilhões deles ficam ativos por inferência . Já a abordagem da PrismML ativa todos os 27 bilhões de parâmetros ao mesmo tempo no mesmo hardware — sem precisar chamar servidores externos. Isso pode turbinar a Siri, ferramentas de escrita e experiências inteligentes em aplicativos, tudo sem sacrificar a privacidade do usuário ou exigir conexão com a nuvem
. Segundo fontes, a Apple tem encontrado dificuldades para comprimir seus próprios modelos de IA para o iPhone sem perda severa de desempenho, o que torna a solução externa da PrismML altamente estratégica
.
O grande diferencial da PrismML é o uso de representação de pesos em 1 bit (ternário) nativo, aplicado a toda a rede neural — e não apenas a camadas selecionadas:
Pesos ternários em toda a rede. Cada peso do modelo é limitado a exatamente três valores {-1, 0, +1}, codificando cerca de 1,58 bits por parâmetro . Isso é fundamentalmente diferente da quantização padrão de 16 bits (FP16) ou mesmo de 8 bits, que ainda usam uma faixa de valores de ponto flutuante ou inteiros.
Treinado nativamente em 1 bit desde o início. Ao contrário da compressão típica, que começa com um modelo de precisão total e o quantiza depois (muitas vezes com perda de precisão), a PrismML treina seus modelos nativamente em precisão de 1 bit desde o zero . A empresa afirma que "a lógica ternária é construída através da própria arquitetura da rede", não sendo um ajuste de última hora
.
Ganhos dramáticos de densidade. O modelo Bonsai 8B de 1 bit da PrismML comprime 8,2 bilhões de parâmetros em apenas 1,15 GB de memória — cerca de 14 vezes menor que um modelo convencional de 16 bits — enquanto alega precisão competitiva com alternativas de precisão total em benchmarks padrão . A compressão do Qwen 3.6 de 27B da empresa também cabe inteiramente na memória do iPhone
.
Eficiência energética. A representação de 1 bit oferece cerca de 5 vezes mais eficiência energética em comparação com modelos de precisão total, e o modelo de 8B roda a mais de 40 tokens por segundo em um iPhone 17 Pro — mais rápido do que as necessidades típicas de uso em tempo real .
Ressalva: As alegações da PrismML ainda não foram verificadas de forma independente em larga escala pela comunidade de pesquisa em IA. A empresa saiu do modo furtivo em 31 de março de 2026, com investimento de US$ 16,25 milhões da Khosla Ventures e da Cerberus Ventures, e seus modelos são lançados como código aberto sob licença Apache 2.0, o que deve permitir a validação externa ao longo do tempo .
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Apple realizou reuniões com a PrismML para avaliar o uso da tecnologia da startup que permite rodar modelos de IA muito maiores diretamente no iPhone, segundo o The Information [1][2][3].
A Apple realizou reuniões com a PrismML para avaliar o uso da tecnologia da startup que permite rodar modelos de IA muito maiores diretamente no iPhone, segundo o The Information [1][2][3]. A PrismML conseguiu comprimir o Qwen 3.6, um modelo denso de 27 bilhões de parâmetros da Alibaba, para rodar por completo em um iPhone 17 Pro — um recorde para o maior modelo de IA já executado em um dispositivo móvel...
Isso é relevante porque os modelos da Apple usam arquiteturas esparsas: na WWDC 2026, a empresa apresentou um modelo de 20 bilhões de parâmetros, mas apenas 1 a 4 bilhões ficam ativos por inferência [4].