SeFi-Image 评测:用 1/5 算力追平 SOTA,这个开源文生图模型凭什么?

跑一张海报还得等十几秒?换个提示词就要重来一整张图?SeFi-Image 用了一种叫”语义优先扩散”的新思路,把图片的结构和细节分开处理,让 5B 参数的模型只用了 Z-Image 大约 1/5 的算力就追平了多项基准。支持中英双语文字渲染,4 步就能快速出图,训练成本低到让同行侧目。但它不能商用,也没有图像编辑能力。到底值不值得上手,拆开来看。

先搞懂它是什么

2026 年的文生图赛道已经卷到让人麻木。每隔几周就有人说”又出了个新的,比之前的强”,然后大家跑一轮测试,感觉差不多,继续等下一个。

SeFi-Image 是刚出炉的一个开源文本生成图像基础模型,由 SeFi-Team 在 2026 年 6 月 21 日通过 arXiv 论文首次公开。它最显眼的标签就一个:用了比 Z-Image 少大约 80% 的算力完成了训练,但在 GenEval、LongTextBench、OneIG 等多个基准上打出了持平甚至超越的成绩。

官网:https://jmliu206.github.io/sefi-web/ | 项目地址:https://github.com/jmliu206/SeFi-Image

SeFi-Image 评测:用 1/5 算力追平 SOTA,这个开源文生图模型凭什么?

这个数字本身就很值得追问:凭什么是它?答案藏在它的核心设计里。SeFi-Image 采用了一种叫”语义优先扩散”(Semantic-First Diffusion,简称 SFD)的架构,把图像生成过程拆成了两条独立的流水线,语义流负责画面结构,纹理流负责颜色和细节。语义流比纹理流提前一步去噪,相当于先生成一张”草图”,再往上填细节。

传统扩散模型的困境在于,结构和纹理混在一起处理,同一时间既要决定”画面里有什么、放在哪”,又要决定”它们长什么样”。信息混杂导致训练效率低。SFD 的设计把这两个任务解耦了,让模型在同一段训练时间内学到更多有效信息。

模型家族提供 1B、2B、5B 三种参数规模,每种又分为 Base(50 步高质量生成)、Turbo(4 步极速出图)和 RL(强化对齐版)三个变体,一共 7 个检查点。技术底座是 FLUX.2 风格的 DiT 骨干网络,搭配 DINOv2 做语义特征提取,Qwen3-VL 做文本编码。

硬实力一览

定位和原理搞清楚了,那功能层面到底能不能打?我挑了几个最核心的看点拆开说。

文字渲染是它真正的杀手锏。 SeFi-Image 在 LongTextBench 长文本渲染基准上拿到 0.978,排第一,压过 Qwen-Image-2512(0.960)和 JoyAI-Image(0.963)。在 CVTG-2K 字符级视觉文本生成测试中词准确率达到 0.895,同样排第一。简单翻译一下:它能在一张图里塞进可读的中英文文字,而且准确率比同类模型高出一截。海报、菜单、标签、展览宣传页这类需要图文混排的场景,它能直接出一张成品图,不用后期再叠文字。

场景构图的结构稳定性也很突出。 因为语义流先确立了物体位置和空间关系,生成的图片在画面布局上不容易出现”手脚畸形”或元素错位。从官网展示的案例来看,高山湖泊的倒影、城市街景的透视关系、多物体场景中的前后遮挡,都保持了较高的合理性。

动漫角色和多风格生成能力均衡。 官网展示了五个主要视觉领域:自然场景、富文本排版、动漫角色、风格化艺术(水墨、毛绒玩具、贴纸等)和人像摄影。风格多样性的覆盖广度不错,尤其是在水墨画风和毛绒玩具质感这种需要差异化纹理处理的场景。

Turbo 版本 4 步出图,速度优势明显。 使用 DMD2 蒸馏技术的 Turbo 版本只需要 4 步推理,在消费级显卡上也能跑出可用的速度。官网数据显示 Turbo 版在基准测试上比完整版下降 1-4 分,但大多数维度上仍能匹配或超过 Z-Image-Turbo。

模型版本的选择可以对照这张表:

版本 参数量 推理步数 引导系数 适用场景
Base 1B/2B/5B 50 4.0 高质量生成、微调起点
Turbo 1B/2B/5B 4 1.0 快速出图、原型验证
RL 5B 50 4.0 更强的指令对齐

SeFi-Image 评测:用 1/5 算力追平 SOTA,这个开源文生图模型凭什么?

从下载到产出

功能参数很好看,但真正部署跑起来的门槛有多高?我走了一遍完整流程。

SeFi-Image 的所有模型权重都托管在 HuggingFace 上,下载前需在平台上同意 CC BY-NC 4.0 许可协议。推理代码在 GitHub 以 MIT 协议开源,pip 安装依赖后直接跑命令行。1B 版本对显存要求友好,8GB 以上消费级显卡就能跑。5B 版本需要 A800 或 H800 级 GPU,个人设备扛不住。

命令行调用很直接。Base 版 50 步生成 1024px 图,A800 上约十几秒。Turbo 版 4 步出图,相同硬件快一个数量级。Python API 也简洁,几行代码集成到项目。

社区支持方面,目前已有 ComfyUI 节点和一键整合包可用,意味着不写代码也能拖拽式使用。这对不爱敲命令行的创作者群体是个好消息。HuggingFace 上 5B-Base 模型已经有 16 个社区互动,SemVAE 权重也在 7 月初释放,说明团队在持续维护。

一个需要注意的细节:模型训练分辨率是 1024px,但论文附录提到同一个 checkpoint 可以在推理时直接提升到 1440px,不需要额外训练。这个特性挺实用,不过目前还没有系统性的高分辨率基准测试数据来验证效果上限。

SeFi-Image 评测:用 1/5 算力追平 SOTA,这个开源文生图模型凭什么?

这样用效率翻倍

基础操作跑通了,但真正用得溜的人都知道几个能拉开差距的技巧。

很多人不知道还有这些进阶用法:

  • 1440px 无训练超分辨率:论文确认同一 checkpoint 可直接将画布扩展到 1440px,保持模型权重和采样参数不变。对于需要高清输出的场景,这个特性省去了一次超分模型的时间和算力开销,几乎零成本提升分辨率。
  • RL 版本做指令对齐微调:5B-RL 版本使用 DiffusionNFT 策略进行了强化学习后训练,在指令遵循、文本渲染精度和 artifact 抑制方面比 Base 版本更强。如果你对生成结果的精确控制有要求,RL 版本是更好的起点,比 Base 版本在 prompt 跟随度上有明显提升。
  • 1B 版本做快速原型验证:别一上来就拉 5B 模型。1B 版本的 OneIG-ZH 综合得分 0.5095,虽然比 5B 的 0.5335 低,但推理速度快得多、显存占用小得多。先用 1B 跑提示词设计和风格调试,确认方向后切 5B 出成品,能省掉大量迭代等待时间。
  • 提示词设计加分步引导:因为 SFD 架构天然区分语义和纹理,在提示词里先描述整体构图和物体关系,再追加纹理和风格细节,生成质量会比一句话全塞进去高。这个技巧在官方示例的场景构图中已经有体现。

和竞品掰手腕

自己用着好不算,放到同赛道里跟几个主流模型正面比一比,差距一目了然。

同类开源文生图模型里,Qwen-Image 2.0、Z-Image、FLUX.2-Klein 是绕不开的三个对手。直接看核心维度的对比:

对比维度 SeFi-Image 5B Qwen-Image 2.0 Z-Image 6B FLUX.2-Klein 9B
GenEval 0.88 0.87 0.84 0.85
DPG-Bench 87.27 88.32 88.14
LongTextBench 0.978 0.945 0.936 0.541
训练算力 125K A800 小时 未公开 约 314K H800 小时 未公开
商用协议 CC BY-NC(禁商用) 未明确 Apache 2.0 Apache 2.0(4B)
图像编辑 ✅(有限)
中文文字渲染 ✅(领先)

差距很清晰。SeFi-Image 在 GenEval 和文字渲染上领先,语义优先设计确实在理解画面结构上占了便宜。DPG-Bench 略低于 Qwen-Image 和 Z-Image,差了约 1 分,复杂多指令场景下可能有感知。

FLUX.2-Klein 的 LongTextBench 只有 0.541,文字渲染是明显短板。Qwen-Image 2.0 的 DPG 综合指令跟随最强,而且支持图像编辑,功能更完整。Z-Image 的 Apache 2.0 协议允许商用,对想集成到产品里的开发者是决定性优势。

最大的差异在协议上。SeFi-Image 和 FLUX.2-Klein 9B 都是 CC BY-NC 禁商用,想用来赚钱就得另想办法。Z-Image 和 FLUX.2-Klein 4B 的 Apache 2.0 则没有这个限制。

大家的使用感受

数据上说它强,但真正跑过的人怎么看?我去社区和评测文章里逛了一圈。

正面声音集中在训练效率上。”用 Z-Image 五分之一的算力跑出差不多的成绩”这个点被反复提及,不少开发者表示在算力成本高企的当下是个很有说服力的指标。文字渲染也被多次点赞,有人测试生成了中英文混排的展览海报,“字基本都对,排版也像模像样”。

OneIG-EN 综合得分 0.5606 排第一也让它在英文指令跟随能力上拿到了不错的社区口碑。多规模模型的设计被评价为”务实”,1B 版本可以在 8G 显存的机器上跑,降低了尝鲜门槛。

吐槽的点也很集中。不能商用是最大的痛点,“东西是好东西,但不能拿来赚钱就只能玩玩”。没有图像编辑功能让一些潜在用户打了退堂鼓,”生图和改图最好在一个模型里搞定”是不少人的期待。

论文是 arXiv 预印本、尚未同行评审这一点也有人提到,但考虑到刚发布不到一个月,这个状态属于正常。有评论指出基准测试条件可能存在细微差异,线性比较时应保留一定余量。

六维评估

社区声音有赞有踩,那从专业维度拆开打分,它到底能拿多少分?

维度 评分 一句话解读
功能完整性 ⭐⭐⭐⭐☆ 生图能力强,但缺图编和商用协议
易用性 ⭐⭐⭐⭐☆ CLI 和 API 简洁,ComfyUI 可用
性价比 ⭐⭐⭐⭐⭐ 完全开源,训练推理成本远低竞品
创新性 ⭐⭐⭐⭐⭐ SFD 架构首次在基础模型规模验证
稳定性 ⭐⭐⭐⭐☆ arXiv 预印本阶段,社区生态在建设
推荐度 ⭐⭐⭐⭐☆ 研究和文字场景力荐,商用需等协议

综合评分:8.2 / 10

创新性满分是因为 SFD 架构此前只在 ImageNet 级实验验证过,SeFi-Image 是第一个把它做到 T2I 基础模型规模的团队。性价比满分因为完全开源,训练算力只有 Z-Image 的 15%-20%,部署成本在全量开源模型里属最低档。

扣分主要落在功能完整性和协议上。没有图像编辑能力在 2026 年已经算一个功能缺口,Qwen-Image 2.0 已经把生图和改图统一到一个模型里了。CC BY-NC 协议意味着它目前只能用于研究和非商业场景。

长处与短板

优势

  • 训练效率惊人:5B 模型仅 125K A800 GPU 小时,约为 Z-Image 的 10%-20%,但多项基准持平或超越
  • 文字渲染领先:LongTextBench 0.978 和 CVTG-2K 0.895 均排同类模型第一
  • 多规模覆盖:1B 到 5B 三个规格加三个变体,从消费级显卡到企业集群都能部署
  • 架构创新清晰:SFD 语义优先设计思路明确,论文写得清楚,学术可复现性高
  • 部署门槛低:CLI 和 API 简洁,有 ComfyUI 节点和整合包,不写代码也能用

不足

  • 不能商用:CC BY-NC 4.0 协议限制非商业用途,集成到产品需要等商用授权
  • 无图像编辑:只支持文生图,不支持图生图、局部修改或多图参考合成
  • 5B 硬件要求高:需要 A800/H800 级别 GPU,个人设备无法跑完整性能
  • 生态尚在起步:arXiv 预印本刚发不到一个月,社区插件和微调案例还在积累

对号入座指南

优缺点都知道,关键是:你到底适不适合用?

  • AI 研究人员:SFD 架构的开源代码和权重是很好的研究起点,训练效率的数据对算力优化方向的论文有参考价值。五个基准测试的完整数据可以直接引用。
  • 开源模型微调爱好者:Base 版本是专门设计来做微调起点的,1B 和 2B 版本在消费级显卡上就能做 LoRA 微调。文字渲染方向的微调效果尤其值得尝试。
  • 创意设计师和内容创作者:海报、菜单、插画、贴纸这些图文需求能直接被覆盖。文字渲染能力是最大加分项,但注意没有图像编辑,想改细节只能重新生成。
  • 需要商用文生图的小团队:暂时不适合。CC BY-NC 协议是硬伤,建议转向 Z-Image(Apache 2.0)或 FLUX.2-Klein 4B(Apache 2.0),或者等 SeFi-Image 后续更新商用协议。

算笔账

产品好是好,但钱包答不答应?好消息是,这个问题对 SeFi-Image 来说不存在。

SeFi-Image 完全开源免费。推理代码以 MIT License 发布,模型权重以 CC BY-NC 4.0 发布,均可免费下载和使用(非商业用途)。没有付费墙、没有 API 调用额度限制、没有隐藏收费。

项目 详情
模型权重 免费下载(HuggingFace,需同意 CC BY-NC 协议)
推理代码 MIT License 开源
API 调用 无(本地部署,无 API 服务)
商用授权 暂不支持(CC BY-NC 禁商用)
硬件成本 1B 版本 8G 显存可跑;5B 需 A800/H800

如果你自己有一台带 8G 以上显存的 N 卡,部署 1B 模型的成本是零。用 5B 完整性能需要租云端 GPU,A800 每小时约 10-15 元,单张图成本远低于商用 API。但对只想点鼠标就出图的用户不够友好。

性价比在同级开源文生图模型里属最高一档,前提是接受本地部署成本和不能商用的限制。

你可能还想问

数据看够了,一些实际使用中的细节问题提前帮你搞清楚。

Q1:SeFi-Image 能商用吗?

A1:目前不能。 模型权重使用 CC BY-NC 4.0 协议,明确禁止商业用途。推理代码是 MIT 协议可以商用,但模型权重不能。需要商用的用户建议关注 Z-Image(Apache 2.0)或 FLUX.2-Klein 4B(Apache 2.0)。


Q2:最低什么显卡能跑?

A2:1B 版本 8GB 显存即可。 NVIDIA RTX 3060 及以上可以跑 1B 模型,2B 建议 12GB 以上,5B 需要 A800 或 H800 级别数据中心 GPU。Turbo 版本对显存要求略低,但 5B-Turbo 在 24GB 消费级显卡上勉强能跑,速度会较慢。


Q3:和 Z-Image 比到底哪个好?

A3:各有胜负,看需求。 文字渲染和训练效率 SeFi-Image 领先;综合指令跟随和商用协议 Z-Image 更好。如果你需要商用或图像编辑能力,选 Z-Image。如果做研究、微调、或文字密集型生成,SeFi-Image 更合适。


Q4:支持图生图或图像编辑吗?

A4:不支持。 SeFi-Image 是纯文本到图像的生成模型,没有内置的图像编辑、局部重绘或多图参考合成功能。Qwen-Image 2.0 和 FLUX.2-Klein 在这方面做得更完整。


Q5:中文提示词支持怎么样?

A5:原生支持中英双语。 SeFi-Image 使用 Qwen3-VL 文本编码器,对中文提示词的理解和文字渲染在同类模型中都属于领先水平。OneIG-ZH 中文综合得分 0.5379,接近 Qwen-Image 的 0.5480。


Q6:怎么快速上手?

A6:两种方式。 会写代码的直接用 GitHub 上的推理脚本,pip install 后一行命令出图。不想写代码的去下载 ComfyUI 整合包,拖拽节点式操作。HuggingFace 上搜 SeFi-Image 即可找到所有模型权重。


Q7:Turbo 版和 Base 版画质差多少?

A7:基准下降 1-4 分。 Turbo 版本用 DMD2 蒸馏技术压缩为 4 步推理,在文字渲染和细节精度上略弱于 50 步的 Base 版,但大多数维度上仍匹配或超过 Z-Image-Turbo。日常使用几乎感知不到差距。


Q8:生成一张图要多久?

A8:取决于版本和硬件。 Base 版本 50 步在 A800 上约 10-20 秒,Turbo 版本 4 步在同样硬件上约 1-3 秒。1B-Turbo 在 RTX 4090 上能跑出接近实时的速度。5B-Turbo 在消费级显卡上需要 5-10 秒。


Q9:能生成多高的分辨率?

A9:训练分辨率 1024px,可扩展到 1440px。 论文验证了同一 checkpoint 可以不训练直接提升到 1440px,保持全局构图和局部细节的连贯性。更高的分辨率暂无系统性的测试数据。


Q10:有 API 服务可以直接调用吗?

A10:目前没有。 SeFi-Image 需要本地部署或云 GPU 推理,没有提供类似 OpenAI 或 Together AI 的 API 调用服务。需要 API 的可以考虑 Qwen-Image(阿里云百炼)或 Z-Image。


最后说几句

SeFi-Image 是 2026 年开源文生图赛道里一个很有诚意的作品。它没有靠堆算力去硬刚,而是用架构创新,语义优先扩散,走出了另一条路。125K A800 GPU 小时训练出一个在多项基准上追平甚至超越 Z-Image 和 Qwen-Image 的模型,这件事本身就说明 SFD 的方向值得继续探索。

对于研究者和开源社区来说,它有完整的技术报告、开源的代码和权重、清晰的架构设计,是一个高质量的起点。对于创作者来说,文字渲染能力是实实在在的加分项。但 CC BY-NC 协议和缺失的图像编辑功能是绕不开的短板,这两点决定了它目前更像一个”研究级工具”而非”生产力工具”。

如果你在做文生图方向的研究,或者在找文字渲染最强的开源模型,SeFi-Image 值得部署一台试试。如果你需要一个能直接商用、带图像编辑的文生图方案,暂时还是 Z-Image 或 Qwen-Image 更合适。

AI工具

Kimi K3 测评:2.8 万亿参数开源模型,前端编程全球第一,到底值不值?

2026-7-17 14:44:14

AI工具

ChatGPT Work 测评:它把打工人的活全包了?

2026-7-21 8:19:27

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧