跑一张海报还得等十几秒?换个提示词就要重来一整张图?SeFi-Image 用了一种叫”语义优先扩散”的新思路,把图片的结构和细节分开处理,让 5B 参数的模型只用了 Z-Image 大约 1/5 的算力就追平了多项基准。支持中英双语文字渲染,4 步就能快速出图,训练成本低到让同行侧目。但它不能商用,也没有图像编辑能力。到底值不值得上手,拆开来看。
先搞懂它是什么
2026 年的文生图赛道已经卷到让人麻木。每隔几周就有人说”又出了个新的,比之前的强”,然后大家跑一轮测试,感觉差不多,继续等下一个。
SeFi-Image 是刚出炉的一个开源文本生成图像基础模型,由 SeFi-Team 在 2026 年 6 月 21 日通过 arXiv 论文首次公开。它最显眼的标签就一个:用了比 Z-Image 少大约 80% 的算力完成了训练,但在 GenEval、LongTextBench、OneIG 等多个基准上打出了持平甚至超越的成绩。
官网:https://jmliu206.github.io/sefi-web/ | 项目地址:https://github.com/jmliu206/SeFi-Image

这个数字本身就很值得追问:凭什么是它?答案藏在它的核心设计里。SeFi-Image 采用了一种叫”语义优先扩散”(Semantic-First Diffusion,简称 SFD)的架构,把图像生成过程拆成了两条独立的流水线,语义流负责画面结构,纹理流负责颜色和细节。语义流比纹理流提前一步去噪,相当于先生成一张”草图”,再往上填细节。
传统扩散模型的困境在于,结构和纹理混在一起处理,同一时间既要决定”画面里有什么、放在哪”,又要决定”它们长什么样”。信息混杂导致训练效率低。SFD 的设计把这两个任务解耦了,让模型在同一段训练时间内学到更多有效信息。
模型家族提供 1B、2B、5B 三种参数规模,每种又分为 Base(50 步高质量生成)、Turbo(4 步极速出图)和 RL(强化对齐版)三个变体,一共 7 个检查点。技术底座是 FLUX.2 风格的 DiT 骨干网络,搭配 DINOv2 做语义特征提取,Qwen3-VL 做文本编码。
硬实力一览
定位和原理搞清楚了,那功能层面到底能不能打?我挑了几个最核心的看点拆开说。
文字渲染是它真正的杀手锏。 SeFi-Image 在 LongTextBench 长文本渲染基准上拿到 0.978,排第一,压过 Qwen-Image-2512(0.960)和 JoyAI-Image(0.963)。在 CVTG-2K 字符级视觉文本生成测试中词准确率达到 0.895,同样排第一。简单翻译一下:它能在一张图里塞进可读的中英文文字,而且准确率比同类模型高出一截。海报、菜单、标签、展览宣传页这类需要图文混排的场景,它能直接出一张成品图,不用后期再叠文字。
场景构图的结构稳定性也很突出。 因为语义流先确立了物体位置和空间关系,生成的图片在画面布局上不容易出现”手脚畸形”或元素错位。从官网展示的案例来看,高山湖泊的倒影、城市街景的透视关系、多物体场景中的前后遮挡,都保持了较高的合理性。
动漫角色和多风格生成能力均衡。 官网展示了五个主要视觉领域:自然场景、富文本排版、动漫角色、风格化艺术(水墨、毛绒玩具、贴纸等)和人像摄影。风格多样性的覆盖广度不错,尤其是在水墨画风和毛绒玩具质感这种需要差异化纹理处理的场景。
Turbo 版本 4 步出图,速度优势明显。 使用 DMD2 蒸馏技术的 Turbo 版本只需要 4 步推理,在消费级显卡上也能跑出可用的速度。官网数据显示 Turbo 版在基准测试上比完整版下降 1-4 分,但大多数维度上仍能匹配或超过 Z-Image-Turbo。
模型版本的选择可以对照这张表:
| 版本 | 参数量 | 推理步数 | 引导系数 | 适用场景 |
|---|---|---|---|---|
| Base | 1B/2B/5B | 50 | 4.0 | 高质量生成、微调起点 |
| Turbo | 1B/2B/5B | 4 | 1.0 | 快速出图、原型验证 |
| RL | 5B | 50 | 4.0 | 更强的指令对齐 |

从下载到产出
功能参数很好看,但真正部署跑起来的门槛有多高?我走了一遍完整流程。
SeFi-Image 的所有模型权重都托管在 HuggingFace 上,下载前需在平台上同意 CC BY-NC 4.0 许可协议。推理代码在 GitHub 以 MIT 协议开源,pip 安装依赖后直接跑命令行。1B 版本对显存要求友好,8GB 以上消费级显卡就能跑。5B 版本需要 A800 或 H800 级 GPU,个人设备扛不住。
命令行调用很直接。Base 版 50 步生成 1024px 图,A800 上约十几秒。Turbo 版 4 步出图,相同硬件快一个数量级。Python API 也简洁,几行代码集成到项目。
社区支持方面,目前已有 ComfyUI 节点和一键整合包可用,意味着不写代码也能拖拽式使用。这对不爱敲命令行的创作者群体是个好消息。HuggingFace 上 5B-Base 模型已经有 16 个社区互动,SemVAE 权重也在 7 月初释放,说明团队在持续维护。
一个需要注意的细节:模型训练分辨率是 1024px,但论文附录提到同一个 checkpoint 可以在推理时直接提升到 1440px,不需要额外训练。这个特性挺实用,不过目前还没有系统性的高分辨率基准测试数据来验证效果上限。

这样用效率翻倍
基础操作跑通了,但真正用得溜的人都知道几个能拉开差距的技巧。
很多人不知道还有这些进阶用法:
-
1440px 无训练超分辨率:论文确认同一 checkpoint 可直接将画布扩展到 1440px,保持模型权重和采样参数不变。对于需要高清输出的场景,这个特性省去了一次超分模型的时间和算力开销,几乎零成本提升分辨率。 -
RL 版本做指令对齐微调:5B-RL 版本使用 DiffusionNFT 策略进行了强化学习后训练,在指令遵循、文本渲染精度和 artifact 抑制方面比 Base 版本更强。如果你对生成结果的精确控制有要求,RL 版本是更好的起点,比 Base 版本在 prompt 跟随度上有明显提升。 -
1B 版本做快速原型验证:别一上来就拉 5B 模型。1B 版本的 OneIG-ZH 综合得分 0.5095,虽然比 5B 的 0.5335 低,但推理速度快得多、显存占用小得多。先用 1B 跑提示词设计和风格调试,确认方向后切 5B 出成品,能省掉大量迭代等待时间。 -
提示词设计加分步引导:因为 SFD 架构天然区分语义和纹理,在提示词里先描述整体构图和物体关系,再追加纹理和风格细节,生成质量会比一句话全塞进去高。这个技巧在官方示例的场景构图中已经有体现。
和竞品掰手腕
自己用着好不算,放到同赛道里跟几个主流模型正面比一比,差距一目了然。
同类开源文生图模型里,Qwen-Image 2.0、Z-Image、FLUX.2-Klein 是绕不开的三个对手。直接看核心维度的对比:
| 对比维度 | SeFi-Image 5B | Qwen-Image 2.0 | Z-Image 6B | FLUX.2-Klein 9B |
|---|---|---|---|---|
| GenEval | 0.88 | 0.87 | 0.84 | 0.85 |
| DPG-Bench | 87.27 | 88.32 | 88.14 | — |
| LongTextBench | 0.978 | 0.945 | 0.936 | 0.541 |
| 训练算力 | 125K A800 小时 | 未公开 | 约 314K H800 小时 | 未公开 |
| 商用协议 | CC BY-NC(禁商用) | 未明确 | Apache 2.0 | Apache 2.0(4B) |
| 图像编辑 | ❌ | ✅ | ✅ | ✅(有限) |
| 中文文字渲染 | ✅(领先) | ✅ | ✅ | 弱 |
差距很清晰。SeFi-Image 在 GenEval 和文字渲染上领先,语义优先设计确实在理解画面结构上占了便宜。DPG-Bench 略低于 Qwen-Image 和 Z-Image,差了约 1 分,复杂多指令场景下可能有感知。
FLUX.2-Klein 的 LongTextBench 只有 0.541,文字渲染是明显短板。Qwen-Image 2.0 的 DPG 综合指令跟随最强,而且支持图像编辑,功能更完整。Z-Image 的 Apache 2.0 协议允许商用,对想集成到产品里的开发者是决定性优势。
最大的差异在协议上。SeFi-Image 和 FLUX.2-Klein 9B 都是 CC BY-NC 禁商用,想用来赚钱就得另想办法。Z-Image 和 FLUX.2-Klein 4B 的 Apache 2.0 则没有这个限制。
大家的使用感受
数据上说它强,但真正跑过的人怎么看?我去社区和评测文章里逛了一圈。
正面声音集中在训练效率上。”用 Z-Image 五分之一的算力跑出差不多的成绩”这个点被反复提及,不少开发者表示在算力成本高企的当下是个很有说服力的指标。文字渲染也被多次点赞,有人测试生成了中英文混排的展览海报,“字基本都对,排版也像模像样”。
OneIG-EN 综合得分 0.5606 排第一也让它在英文指令跟随能力上拿到了不错的社区口碑。多规模模型的设计被评价为”务实”,1B 版本可以在 8G 显存的机器上跑,降低了尝鲜门槛。
吐槽的点也很集中。不能商用是最大的痛点,“东西是好东西,但不能拿来赚钱就只能玩玩”。没有图像编辑功能让一些潜在用户打了退堂鼓,”生图和改图最好在一个模型里搞定”是不少人的期待。
论文是 arXiv 预印本、尚未同行评审这一点也有人提到,但考虑到刚发布不到一个月,这个状态属于正常。有评论指出基准测试条件可能存在细微差异,线性比较时应保留一定余量。
六维评估
社区声音有赞有踩,那从专业维度拆开打分,它到底能拿多少分?
| 维度 | 评分 | 一句话解读 |
|---|---|---|
| 功能完整性 | ⭐⭐⭐⭐☆ | 生图能力强,但缺图编和商用协议 |
| 易用性 | ⭐⭐⭐⭐☆ | CLI 和 API 简洁,ComfyUI 可用 |
| 性价比 | ⭐⭐⭐⭐⭐ | 完全开源,训练推理成本远低竞品 |
| 创新性 | ⭐⭐⭐⭐⭐ | SFD 架构首次在基础模型规模验证 |
| 稳定性 | ⭐⭐⭐⭐☆ | arXiv 预印本阶段,社区生态在建设 |
| 推荐度 | ⭐⭐⭐⭐☆ | 研究和文字场景力荐,商用需等协议 |
综合评分:8.2 / 10
创新性满分是因为 SFD 架构此前只在 ImageNet 级实验验证过,SeFi-Image 是第一个把它做到 T2I 基础模型规模的团队。性价比满分因为完全开源,训练算力只有 Z-Image 的 15%-20%,部署成本在全量开源模型里属最低档。
扣分主要落在功能完整性和协议上。没有图像编辑能力在 2026 年已经算一个功能缺口,Qwen-Image 2.0 已经把生图和改图统一到一个模型里了。CC BY-NC 协议意味着它目前只能用于研究和非商业场景。
长处与短板
优势
-
训练效率惊人:5B 模型仅 125K A800 GPU 小时,约为 Z-Image 的 10%-20%,但多项基准持平或超越 -
文字渲染领先:LongTextBench 0.978 和 CVTG-2K 0.895 均排同类模型第一 -
多规模覆盖:1B 到 5B 三个规格加三个变体,从消费级显卡到企业集群都能部署 -
架构创新清晰:SFD 语义优先设计思路明确,论文写得清楚,学术可复现性高 -
部署门槛低:CLI 和 API 简洁,有 ComfyUI 节点和整合包,不写代码也能用
不足
-
不能商用:CC BY-NC 4.0 协议限制非商业用途,集成到产品需要等商用授权 -
无图像编辑:只支持文生图,不支持图生图、局部修改或多图参考合成 -
5B 硬件要求高:需要 A800/H800 级别 GPU,个人设备无法跑完整性能 -
生态尚在起步:arXiv 预印本刚发不到一个月,社区插件和微调案例还在积累
对号入座指南
优缺点都知道,关键是:你到底适不适合用?
-
AI 研究人员:SFD 架构的开源代码和权重是很好的研究起点,训练效率的数据对算力优化方向的论文有参考价值。五个基准测试的完整数据可以直接引用。 -
开源模型微调爱好者:Base 版本是专门设计来做微调起点的,1B 和 2B 版本在消费级显卡上就能做 LoRA 微调。文字渲染方向的微调效果尤其值得尝试。 -
创意设计师和内容创作者:海报、菜单、插画、贴纸这些图文需求能直接被覆盖。文字渲染能力是最大加分项,但注意没有图像编辑,想改细节只能重新生成。 -
需要商用文生图的小团队:暂时不适合。CC BY-NC 协议是硬伤,建议转向 Z-Image(Apache 2.0)或 FLUX.2-Klein 4B(Apache 2.0),或者等 SeFi-Image 后续更新商用协议。
算笔账
产品好是好,但钱包答不答应?好消息是,这个问题对 SeFi-Image 来说不存在。
SeFi-Image 完全开源免费。推理代码以 MIT License 发布,模型权重以 CC BY-NC 4.0 发布,均可免费下载和使用(非商业用途)。没有付费墙、没有 API 调用额度限制、没有隐藏收费。
| 项目 | 详情 |
|---|---|
| 模型权重 | 免费下载(HuggingFace,需同意 CC BY-NC 协议) |
| 推理代码 | MIT License 开源 |
| API 调用 | 无(本地部署,无 API 服务) |
| 商用授权 | 暂不支持(CC BY-NC 禁商用) |
| 硬件成本 | 1B 版本 8G 显存可跑;5B 需 A800/H800 |
如果你自己有一台带 8G 以上显存的 N 卡,部署 1B 模型的成本是零。用 5B 完整性能需要租云端 GPU,A800 每小时约 10-15 元,单张图成本远低于商用 API。但对只想点鼠标就出图的用户不够友好。
性价比在同级开源文生图模型里属最高一档,前提是接受本地部署成本和不能商用的限制。
你可能还想问
数据看够了,一些实际使用中的细节问题提前帮你搞清楚。
Q1:SeFi-Image 能商用吗?
A1:目前不能。 模型权重使用 CC BY-NC 4.0 协议,明确禁止商业用途。推理代码是 MIT 协议可以商用,但模型权重不能。需要商用的用户建议关注 Z-Image(Apache 2.0)或 FLUX.2-Klein 4B(Apache 2.0)。
Q2:最低什么显卡能跑?
A2:1B 版本 8GB 显存即可。 NVIDIA RTX 3060 及以上可以跑 1B 模型,2B 建议 12GB 以上,5B 需要 A800 或 H800 级别数据中心 GPU。Turbo 版本对显存要求略低,但 5B-Turbo 在 24GB 消费级显卡上勉强能跑,速度会较慢。
Q3:和 Z-Image 比到底哪个好?
A3:各有胜负,看需求。 文字渲染和训练效率 SeFi-Image 领先;综合指令跟随和商用协议 Z-Image 更好。如果你需要商用或图像编辑能力,选 Z-Image。如果做研究、微调、或文字密集型生成,SeFi-Image 更合适。
Q4:支持图生图或图像编辑吗?
A4:不支持。 SeFi-Image 是纯文本到图像的生成模型,没有内置的图像编辑、局部重绘或多图参考合成功能。Qwen-Image 2.0 和 FLUX.2-Klein 在这方面做得更完整。
Q5:中文提示词支持怎么样?
A5:原生支持中英双语。 SeFi-Image 使用 Qwen3-VL 文本编码器,对中文提示词的理解和文字渲染在同类模型中都属于领先水平。OneIG-ZH 中文综合得分 0.5379,接近 Qwen-Image 的 0.5480。
Q6:怎么快速上手?
A6:两种方式。 会写代码的直接用 GitHub 上的推理脚本,pip install 后一行命令出图。不想写代码的去下载 ComfyUI 整合包,拖拽节点式操作。HuggingFace 上搜 SeFi-Image 即可找到所有模型权重。
Q7:Turbo 版和 Base 版画质差多少?
A7:基准下降 1-4 分。 Turbo 版本用 DMD2 蒸馏技术压缩为 4 步推理,在文字渲染和细节精度上略弱于 50 步的 Base 版,但大多数维度上仍匹配或超过 Z-Image-Turbo。日常使用几乎感知不到差距。
Q8:生成一张图要多久?
A8:取决于版本和硬件。 Base 版本 50 步在 A800 上约 10-20 秒,Turbo 版本 4 步在同样硬件上约 1-3 秒。1B-Turbo 在 RTX 4090 上能跑出接近实时的速度。5B-Turbo 在消费级显卡上需要 5-10 秒。
Q9:能生成多高的分辨率?
A9:训练分辨率 1024px,可扩展到 1440px。 论文验证了同一 checkpoint 可以不训练直接提升到 1440px,保持全局构图和局部细节的连贯性。更高的分辨率暂无系统性的测试数据。
Q10:有 API 服务可以直接调用吗?
A10:目前没有。 SeFi-Image 需要本地部署或云 GPU 推理,没有提供类似 OpenAI 或 Together AI 的 API 调用服务。需要 API 的可以考虑 Qwen-Image(阿里云百炼)或 Z-Image。
最后说几句
SeFi-Image 是 2026 年开源文生图赛道里一个很有诚意的作品。它没有靠堆算力去硬刚,而是用架构创新,语义优先扩散,走出了另一条路。125K A800 GPU 小时训练出一个在多项基准上追平甚至超越 Z-Image 和 Qwen-Image 的模型,这件事本身就说明 SFD 的方向值得继续探索。
对于研究者和开源社区来说,它有完整的技术报告、开源的代码和权重、清晰的架构设计,是一个高质量的起点。对于创作者来说,文字渲染能力是实实在在的加分项。但 CC BY-NC 协议和缺失的图像编辑功能是绕不开的短板,这两点决定了它目前更像一个”研究级工具”而非”生产力工具”。
如果你在做文生图方向的研究,或者在找文字渲染最强的开源模型,SeFi-Image 值得部署一台试试。如果你需要一个能直接商用、带图像编辑的文生图方案,暂时还是 Z-Image 或 Qwen-Image 更合适。
