iris.c性能实测榜单:M3 Max跑赢PyTorch,7款硬件512x512生成速度全对比 iris.c性能实测榜单M3 Max跑赢PyTorch7款硬件512x512生成速度全对比【免费下载链接】iris.cFlux 2 image generation model pure C inference项目地址: https://gitcode.com/gh_mirrors/fl/iris.ciris.c 是一个用纯 C 语言实现的 Flux 2 图像生成模型推理管线也就是零 Python 依赖的本地 AI 绘图工具。本文汇总官方基准与社区实测数据给出 M3 Max、M3 Ultra 等 7 款硬件在 512x512 分辨率下的 AI 绘图生成速度完整榜单并逐秒拆解 M3 Max 上 7.6 秒出图的耗时构成帮你判断自己的设备能不能跑、跑得快不快。 测试环境与官方基准C 版 vs PyTorch 生成速度官方基准在 MacBook ProM3 Max、40 核 GPU、128GB 内存上测得使用 Flux 4B 蒸馏模型4 步去噪数据来自 README.md 的 How Fast Is It? 章节图片尺寸iris.cC MPSPyTorchMPS快慢对比256x2565.2s11sC 版快约 2.1 倍512x5127.6s13sC 版快约 1.7 倍1024x102419s25sC 版快约 1.3 倍口径说明C 版为含模型加载的完整墙钟时间、无预热PyTorch 一侧为公平起见去掉了约 5~10 秒的库导入开销。即便如此C 版在所有分辨率下依然胜出。下图就是基准命令生成的 512x512 样例图想复现这个成绩跑一条命令即可./iris -d flux-klein-4b -p A woman wearing sunglasses -o /tmp/bench.png -W 512 -H 512 -v --seed 42完整的优化日志与每一步耗时都记录在 SPEED.md 中。 7款硬件 512x512 AI 绘图速度实测榜单社区用户贡献了 7 套硬件的 512x512 实测数据同为 4B 蒸馏模型、4 步去噪来源见 README.md名次硬件加速后端512x512 耗时相对 M3 Max1Apple M3 UltraMPSMetal GPU4.5s—2Apple M3 MaxMPSMetal GPU7.6s基准3MacBook Pro M4MPSMetal GPU19s慢 2.5 倍4MacBook Pro M1 MaxMPSMetal GPU39.9s慢 5.2 倍5Apple M1 ProMPSMetal GPU42.4s慢 5.6 倍6AMD Ryzen 7800X3DBLASCPU47.8s慢 6.3 倍7Intel i5-1135G7BLASCPU218s慢 28.7 倍三个清晰结论Apple Silicon MPS 是最快路径M3 Ultra 4.5 秒就能出一张 512x512 图CPUBLAS 后端比顶级 Apple 芯片慢 6~7 倍但在 8GB 低内存机器上仍是可行的本地推理方案代差最大可达 48 倍从 M3 Ultra4.5s到 Intel i5-1135G7218s。 M3 Max 的 7.6 秒花在哪了按 SPEED.md 的 512x512 基准逐项拆解阶段耗时说明文本编码~1.0sQwen3-4B 把提示词转为嵌入全程驻留 GPU去噪4 步~4.05s第 1 步约 1.08s含 GPU 预热第 2~4 步各约 0.99sVAE 解码~0.5s潜空间 → RGB 图像全程驻留 GPU模型加载及其他~1.9s含约 1.3s 的 mmap 权重缓存预热合计约 7.5~7.6s与榜单数据吻合。加上-v参数后终端会实时打印去噪各阶段的耗时拆解例如这张机械鹰飞行图1024x512总耗时 17.5 秒⚡ 纯 C 推理为何能跑赢 PyTorch答案藏在 4 个关键优化里完整实验记录见 SPEED.md单命令缓冲整体执行Monolithic GPU batch把每步去噪的 5 次 GPU 同步压缩为 1 次去噪耗时累计再降约 9%见 SPEED.mdGPU 驻留文本编码器Qwen3 的 36 层不再逐层回传 CPU同步点从 72 次降到 1 次文本编码从 1.9s 缩短到 1.0s见 SPEED.mdGPU 驻留 VAE 解码器512x512 解码从 1.6s 降到 0.5s提升 69%见 SPEED.mdmmap 权重加载默认按需映射约 7GB 的 bf16 权重峰值内存从 ~16GB 降到 ~4-5GB且 MPS 可零拷贝直接使用——这也是 8GB 内存机器能跑起来的原因。整套 Metal/MPS GPU 管线由 iris_metal.m 与 iris_shaders.metal 中的纯 C/着色器代码实现。 新手最快上手3 条命令生成第一张图# 1. 克隆仓库并编译Apple Silicon 用 mps 后端 git clone https://gitcode.com/gh_mirrors/fl/iris.c cd iris.c make mps # 2. 下载 Flux 4B 蒸馏模型约 16GB ./download_model.sh 4b # 3. 生成图片 ./iris -d flux-klein-4b -p A woman wearing sunglasses -o output.png非 Apple 平台可改用make blasCPU OpenBLAS构建方式详见 Makefile模型下载也有 download_model.py 作为替代方案。几个实用小技巧加-v查看各阶段计时加-S 42固定种子保证结果可复现--show可在支持图形协议的终端Kitty、Ghostty、iTerm2、WezTerm里直接显示生成结果默认开启的 mmap 让低内存机器也能跑无需额外配置。 不同硬件的性能预期谁适合本地跑 FluxM3/M4 Ultra、M3 MaxmacOS512x512 约 4.5~7.6 秒1024x1024 约 14~19 秒体验最佳M4 基础款macOS512x512 约 19 秒流畅可用M1 Pro / M1 MaxmacOS约 40 秒一张耐心可用高端 CPU如 Ryzen 7800X3D OpenBLAS512x512 约 48 秒偶尔出图没问题低功耗笔记本 CPUi5-1135G7 级别单张约 3.6 分钟不建议日常使用。另外提醒以上均为 4B 蒸馏模型4 步的成绩base 模型50 步 CFG约慢 25 倍追求画质时可用 10 步在质量与速度之间折中。一句话总结iris.c 证明了 AI 绘图本地推理不必再依赖 Python 环境——纯 C 实现加 mmap 权重8GB 内存即可运行M3 Max 上 7.6 秒生成一张 512x512 图片并全面跑赢 PyTorch 官方管线。如果你有一台 Apple Silicon 电脑这就是目前跑 Flux 最快的本地方式之一。【免费下载链接】iris.cFlux 2 image generation model pure C inference项目地址: https://gitcode.com/gh_mirrors/fl/iris.c创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考