Python
在 Apple Silicon 上使用 MTPLX 将本地神经网络速度提升两倍
MTPLX 利用 Qwen 3.5-3.8 等现代模型中内置的 MTP heads,在 Apple Silicon 上实现高达 2.24 倍的加速,且无需单独的 draft model。
语言
首页语言
板块
MTPLX 利用 Qwen 3.5-3.8 等现代模型中内置的 MTP heads,在 Apple Silicon 上实现高达 2.24 倍的加速,且无需单独的 draft model。
使用 Soup 在消费级硬件上微调 8B 模型的实用指南——一款将分层流式处理和自动化流水线引入小显存 GPU 的 CLI 工具。
Skales 是一款面向桌面和移动设备的本地 AI 代理,能在你的系统上自主运行、读取文件、管理浏览器,并执行任务链而无需持续监控。
工程师 Andrey Mikhailov 开发了 TurboFieldfare,这是一款自定义 Swift/Metal 运行时,可在基础款 MacBook Air M2 上仅用 2 GB 内存运行 Google 的 Gemma 4 26B-A4B 模型。