O novo A20 Pro da Apple consegue executar um modelo de 27 mil milhões de parâmetros com o dobro da velocidade de geração de tokens face ao A19 Pro. A demonstração, partilhada a 19 de setembro pelo developer Adrien Grondin, foi realizada num iPhone 18 Pro e evidencia o maior avanço de sempre da Apple na execução local de modelos de IA.
Este salto de desempenho é possível graças a uma arquitetura inédita: o A20 Pro integra duas Neural Engines de 16 núcleos, algo nunca visto em Apple Silicon, combinadas com 12 GB de memória LPDDR5X de maior velocidade e uma largura de banda unificada de 115,2 GB/s.
O que revela a demonstração
Na comparação lado a lado, o iPhone 18 Pro gera tokens de forma visivelmente mais rápida do que o iPhone 17 Pro, tornando a inferência local de modelos de grande dimensão mais prática num smartphone.
O modelo utilizado (Bonsai 27B, da PrismML) é um modelo visão‑linguagem comprimido para cerca de 1,125 bits por peso, reduzindo o tamanho de 47,7 GB para apenas 3,5 GB. Esta compressão permite que o modelo seja executado sem memory offloading, algo essencial para dispositivos móveis.
Contudo, Grondin destacou uma limitação: o novo Bonsai 2, mesmo com quantização a 2 bits, continua demasiado grande para caber na memória do iPhone 18 Pro, levando a que o desempenho se degrade quando se tenta correr o modelo no dispositivo.
Ganhos mais amplos do A20 Pro da Apple
Fabricado no processo de 2 nm da TSMC, o A20 Pro oferece:
- +20% de desempenho CPU
- +40% de desempenho gráfico
- comparativamente ao A19 Pro, segundo a Apple.
A Neural Engine apresenta um pico de computação que ultrapassa o próprio GPU de 7 núcleos em tarefas otimizadas para o NPU, uma observação destacada pelo analista Max Weinbach. Nos testes do Geekbench 7, publicados pela Tom’s Hardware, o A20 Pro estabeleceu um novo recorde de single‑core em smartphones, superando processadores desktop como o Intel Core i9 e o AMD Ryzen 9 em até 32% nos testes de single thread.
Apesar do avanço significativo, a demonstração também evidencia os limites atuais da IA totalmente local. Modelos maiores ou com quantização menos agressiva continuam a não caber na memória dos smartphones, obrigando a versões altamente comprimidas.
Fica ainda mais conectado:
- Avengers Doomsday: novo relatório revela o artefacto que pode redefinir o MCU
- O superiate de €350 milhões que levou o CEO da Revolut a tribunal
- Razer Tartarus V2 Pro é o novo keypad gaming ótico analógico

