Python
在 Apple Silicon 上使用 MTPLX 将本地神经网络速度提升两倍
MTPLX 利用 Qwen 3.5-3.8 等现代模型中内置的 MTP heads,在 Apple Silicon 上实现高达 2.24 倍的加速,且无需单独的 draft model。
语言
首页语言
板块
MTPLX 利用 Qwen 3.5-3.8 等现代模型中内置的 MTP heads,在 Apple Silicon 上实现高达 2.24 倍的加速,且无需单独的 draft model。
工程师 Andrey Mikhailov 开发了 TurboFieldfare,这是一款自定义 Swift/Metal 运行时,可在基础款 MacBook Air M2 上仅用 2 GB 内存运行 Google 的 Gemma 4 26B-A4B 模型。