In questo articolo Indice dei contenuti 2 sezioni
Un iPhone 17 Pro Max collegato con un semplice cavo può trasformarsi in un vero acceleratore AI per un MacBook Pro. Lo ha dimostrato uno sviluppatore che ha messo in comunicazione lo smartphone di Apple con un portatile equipaggiato con chip M4 Pro tramite USB C, distribuendo tra le due macchine l’esecuzione del modello Qwen3.8 nella versione 27B. Il risultato non è affatto marginale, perché nella fase di prefill le prestazioni sono cresciute fino al 44%.
L’esperimento è stato condiviso su Reddit dall’utente StayLameBro e parte da un’idea piuttosto facile da raccontare, anche se decisamente meno banale da mettere in pratica. Invece di lasciare tutto il peso dell’intelligenza artificiale sulle spalle del computer, una parte del lavoro viene spostata sul telefono. Due dispositivi che di solito convivono sulla stessa scrivania senza collaborare davvero finiscono così per dividersi i compiti, ognuno con la propria fetta di calcoli da portare a termine.
Il limite della memoria e la divisione dei compiti tra Mac e iPhone
Il problema di partenza riguarda la memoria. Il MacBook Pro usato per la prova dispone di 24 GB di memoria unificata, una dotazione sufficiente per far girare il modello ma che finisce per pesare sulle prestazioni man mano che il contesto si allarga. Anche spingendo la memoria assegnata oltre i 20 GB, la configurazione resta ferma a una context window di 64K. Un tetto che con un modello di queste dimensioni si fa sentire parecchio e che rende la macchina meno brillante proprio quando il lavoro si fa più impegnativo.
Da qui la strada scelta da StayLameBro, cioè spezzare il carico tra Mac e smartphone. Durante il prefill il portatile elabora i layer da 1 a 40 di ogni blocco da 256 token e poi spedisce le attivazioni al telefono. A quel punto entra in scena iPhone 17 Pro Max, che si occupa dei layer da 41 a 64 sfruttando la GPU del chip A19 Pro. Nel frattempo il Mac non resta ad aspettare e può già cominciare a lavorare sul blocco successivo. Una specie di catena di montaggio, insomma, in cui nessuno dei due dispositivi rimane fermo troppo a lungo e il flusso di dati scorre senza grandi interruzioni.
I numeri del test tra GPU e Neural Engine
Stando ai risultati pubblicati, la GPU dello smartphone rende questa porzione dell’elaborazione circa 2,4 volte più rapida rispetto a un’esecuzione priva di tale accelerazione. Non è però l’unico componente chiamato in causa. Anche il Neural Engine ha un ruolo preciso, visto che ogni 16K di contesto precedente viene compilato in un modello dedicato. L’effetto si nota sul tempo necessario a scrivere ciascun token, che con un contesto da 140K scende da 279 a 176 millisecondi rispetto all’uso della sola GPU dell’A19 Pro.
I vantaggi più evidenti arrivano comunque dal prefill, ed è qui che la collaborazione tra i due dispositivi mostra tutto il suo peso. Caricando un file da 2mila token in una sessione salvata, a 8K di contesto il Mac da solo tocca 132 token al secondo, mentre con iPhone collegato arriva a 177, circa il 35% in più. Salendo a 16K il salto diventa ancora più netto, da 109 a 157 token al secondo, con un guadagno del 44% che rappresenta il picco registrato nella prova. A 32K, infine, si passa da 101 a 130 token al secondo, con un incremento di circa il 29%.
Fonte: TecnoAndroid








