De acordo com Beating, a Google está a desenvolver o chip de inferência de IA Frozen v2, que vai incorporar parte da arquitetura do Gemini diretamente no hardware, reduzindo a sobrecarga de computação e o movimento de dados durante a execução do modelo. Prevê-se que o chip processe entre 6 a 10 vezes mais tokens por watt do que o mais recente TPU da Google, com a implementação planeada para, logo, em 2028.
A iniciativa pretende dar resposta ao agravamento da escassez de chips da Google, que já levou a Google Cloud a recusar encomendas de clientes externos. O Frozen v2 vai operar em paralelo com o TPU; enquanto o TPU suporta vários modelos, o Frozen v2 prioriza a eficiência em vez da flexibilidade.