Python
Come raddoppiare la velocità delle reti neurali locali su Apple Silicon con MTPLX
MTPLX sfrutta le testine MTP integrate nei modelli come Qwen 3.5-3.8 per ottenere fino a 2,24x di speedup su Apple Silicon senza un modello draft separato.
Lingua
HomeLinguaggi
Sezioni
MTPLX sfrutta le testine MTP integrate nei modelli come Qwen 3.5-3.8 per ottenere fino a 2,24x di speedup su Apple Silicon senza un modello draft separato.
L'ingegnere Andrey Mikhailov ha creato TurboFieldfare, un runtime personalizzato Swift/Metal che esegue il modello Gemma 4 26B-A4B di Google in soli 2 GB di RAM su un MacBook Air M2 base.