GLIGEN是一款开放式的条件式图像生成学术项目站点,核心为基于扩散模型的可控图像生成技术。用户可结合文本描述与空间边界框、参考图像等条件,生成符合指定布局与内容要求的图像;模型采用模块化训练设计,保留预训练扩散模型的基础生成能力的同时,扩展了空间控制属性。该站点面向AI图像生成研究者、计算机视觉从业者、内容创作人员、设计人员等群体,可用于学术研究验证、可控图像内容创作、多模态模型效果测试、概念设计初稿生成等场景,帮助用户在图像生成过程中实现更精准的内容与布局控制。
- 运营状态
- 正常运营
- 地址
- gligen.github.io
- 定价模式
- GLIGEN作为学术开源项目,其核心模型
- 是否开源
- 闭源
- 适合人群
- AI图像生成研究者、计算机视觉从业者、UI设计师、创意内容创作者
- 收录时间
- 2026/6/14
- 访问量
- 0 次
编辑点评
这款基于扩散模型的可控图像生成项目,在现有文生图模型的基础上拓展了空间布局控制能力,解决了传统文生图模型难以精准控制元素位置、大小的痛点。其采用的模块化训练设计,既保留了预训练扩散模型的通用生成能力,又降低了新增控制功能的训练成本,对于后续可控生成模型的发展有较高的参考价值。站点除了提供详细的论文说明、技术架构介绍外,还配备了可直接体验的在线演示功能,用户无需自行部署模型即可测试不同条件下的生成效果,无论是从事相关技术研究的人员,还是需要可控图像生成能力的创作者,都可以通过该站点获取所需的资源与工具。相比其他同类可控生成项目,它对开放概念的泛化能力表现突出,能够支持更多新型概念组合的生成,适配更多创意类的使用需求。
核心功能
使用指南
- 1
进入GLIGEN官方站点,找到在线演示功能入口,浏览页面内的功能说明与生成示例,了解模型支持的控制条件与生成效果范围。
- 2
选择合适的生成模式,可选择基础文本生成模式或者带布局控制的生成模式,根据自身需求确定本次生成需要使用的约束条件。
- 3
输入对应的生成条件,若使用布局控制则绘制边界框并为每个框填写元素描述,同时可补充整体图像的风格、场景等全局文本描述。
- 4
确认所有条件设置无误后,点击生成按钮等待模型推理,推理过程中请勿关闭或刷新页面,避免生成过程中断。
- 5
生成完成后查看结果图像,若不符合预期可调整文本描述、边界框位置或参数后重新生成,满意后可下载图像到本地使用。
优势与不足
优点5 项
"支持边界框与文本组合控制,可精准指定图像元素的位置、尺寸与内容"
"模块化架构设计,保留基础模型通用生成能力的同时,扩展了控制功能"
"支持开放概念泛化,可生成训练数据中未出现过的新概念组合图像"
"提供在线演示界面,无需本地部署模型即可体验核心生成功能"
"技术文档与论文资料公开透明,方便研究者学习参考其架构设计"
不足4 项
"在线演示功能的生成分辨率有限,无法直接生成高分辨率商用图像"
"暂不支持批量生成功能,单次仅能生成单张图像,效率较低"
"生成效果存在不确定性,部分复杂布局与概念组合可能出现元素错乱的情况"
"没有中文操作界面,对不熟悉英文的用户存在使用门槛"
定价说明
GLIGEN作为学术开源项目,其核心模型代码、论文资料与在线演示功能均向公众免费开放,免费使用无功能限制,用户可直接访问站点体验在线演示,也可下载开源代码在本地部署调整。目前项目无官方付费版本,若需要商用定制化的部署方案或更高算力的生成支持,可联系项目研发团队沟通合作需求,非商业的研究、学习、非盈利创作场景使用免费版本即可满足需求。
价格和授权政策可能变化,请以官网最新信息为准
适合人群与场景
- AI图像生成研究者
模型架构研究场景
- 计算机视觉从业者
可控生成技术落地场景
- UI设计师
界面元素布局初稿生成场景
- 创意内容创作者
定制化图像素材生成场景
- 概念设计师
产品/场景概念草图生成场景
- 多模态技术学习者
扩散模型原理学习场景
- 数字艺术家
艺术创作布局预演场景
常见问题
深度了解
GLIGEN作为基于扩散模型的可控图像生成技术项目,为用户提供了更精准的图像生成控制能力,解决了传统文生图模型布局不可控的痛点。项目核心采用模块化设计,冻结预训练扩散模型的参数,仅新增控制注入模块进行训练,既保留了基础模型对海量通用概念的生成能力,又降低了功能扩展的训练成本,支持开放世界的条件图像生成,对未出现在训练数据中的新概念组合也有较好的泛化能力。
站点内置在线演示功能,用户无需自行部署复杂的模型环境,即可体验文本加边界框的可控生成流程,输入全局文本描述,为不同区域绘制边界框并指定对应内容,即可生成符合预设布局的图像,适合AI图像生成研究者验证可控生成技术效果,也适合设计师、创意创作者快速生成符合布局要求的概念草图。
同时GLIGEN完全开源,提供完整的模型代码、技术论文与部署文档,研究人员可以基于其架构进行二次开发,扩展更多类型的控制条件,或者适配特定领域的生成需求。目前项目支持文本描述、边界框、参考图像等多类条件的组合输入,可满足不同场景下的可控生成需求,是计算机视觉领域与创意生成领域的重要技术项目。
Ready to try
准备好体验 GLIGEN 了吗?
点击下方按钮在新标签页打开官网,开始探索它的全部功能。
相关工具

Midjourney
免费Midjourney是知名AI图像生成平台,核心定位为通过自然语言输入生成高质量视觉作品的创作辅助工具。其核心功能包含文本生成图像、局部画面重绘、多轮迭代优化,可满足不同创作阶段的调整需求。该平台主要面向创意领域从业者及爱好者,可广泛应用于概念设计、插画创作、游戏原画产出、广告创意视觉落地、当代视觉艺术探索等多个场景,帮助创作者降低视觉落地的执行门槛,拓展创意表达的边界。
Stable Diffusion Model
Stable Diffusion Model是专注于AI图像生成的在线服务平台,基于稳定扩散算法为用户提供文本生成图像、AI头像定制、提示词参考等功能。平台无需本地部署复杂环境,用户输入文字描述即可生成对应风格的视觉内容,适合设计从业者、内容创作者、艺术爱好者等群体,可应用于广告创意配图制作、个人社交账号头像设计、概念艺术草图产出、毕业设计视觉元素补充等多个场景,降低AI图像创作的技术门槛。

Flux AI Image Generator
Flux AI Image Generator是一款依托先进AI大模型开发的在线AI图像生成工具,支持用户通过文本提示词生成定制化图像,还提供图像风格转换、高清修复、图像扩展等衍生图像处理功能。核心功能覆盖文生图、图生图、高清修复、局部重绘、图像扩展等多种需求,面向创意设计从业者、内容创作者、自媒体运营者以及AI绘画爱好者开放,可应用于海报设计素材制作、自媒体配图生成、概念设计草图绘制、个人艺术创作、社交平台头像制作等多种场景。
Qwen-Image AI
Qwen-Image AI是阿里巴巴推出的AI图像生成平台,核心定位为面向中文用户的高精度AI图像创作工具,依托通义千问技术体系,支持中文文本生成图像、精准中文文本渲染、图像编辑拓展等功能。平台主打高真实感图像生成与准确的中文文字生成能力,可满足不同创作场景的图像需求。目标用户覆盖平面设计师、内容创作者、电商运营人员、学生、手工创作者、商业品牌策划人员等,适用于商业宣传图制作、社交内容配图创作、设计概念图生成、带中文文字的文创产品设计等多种使用场景。
Seedream 4.0
Seedream 4.0是字节跳动推出的多模态AI图像生成与编辑工具,核心定位为面向视觉内容创作者的AI图像生产力工具。核心功能包括文本生成图像、局部重绘、图像扩展、风格迁移、分辨率增强,可满足不同场景下的图像创作与修改需求。目标用户覆盖设计师、自媒体运营者、数字艺术创作者、产品经理、高校设计专业学生等群体,可应用于商业海报设计、产品概念草图输出、社交平台配图创作、数字艺术作品打磨、电商商品图优化等多个场景,依托字节跳动的多模态技术能力,支持复杂场景的图像生成与精细化编辑需求。

Flux 1.1 Pro AI
免费Flux 1.1 Pro AI是主打文本生成图像的人工智能创作平台,依托优化后的AI生成模型,可将用户输入的文本描述转换为高完成度的视觉作品。平台核心功能包含高精度文生图生成、多参数风格调整、批量出图管理,同时支持生成结果的二次修改与格式导出,面向创意领域从业者及普通创作爱好者提供服务,可应用于商业海报设计、插画创作、产品原型可视化、自媒体内容配图等多种场景,帮助用户降低视觉内容的制作门槛,缩短创意到落地的转化周期。
![FLUX1.1 [pro]图标](https://br-sunny-cat-749b2baf.supabase2.aidap-global.cn-beijing.volces.com/storage/v1/object/public/site-assets/logos/blackforestlabs.ai.png)
FLUX1.1 [pro]
FLUX1.1 [pro]是Black Forest Labs推出的商业化图像生成模型,对应页面为官方产品发布与API说明页面,核心定位是为用户提供性能升级的AI图像生成服务。核心功能包括六倍于前代的图像生成速度、更高的提示词遵循度与画面质量、支持多场景的定制化生成选项。目标用户覆盖AI应用开发者、内容创作团队、商业设计机构、数字营销从业者等群体,可应用于批量素材生产、产品概念图设计、营销视觉内容制作、AI应用图像能力接入等场景,帮助用户提升图像生成的效率与输出效果。

FLUX-1.net
FLUX-1.net是基于FLUX系列图像生成模型开发的在线AI图像生成服务平台,核心定位是为不同创作需求的用户提供便捷的文本生成图像服务。平台支持用户通过输入文本描述快速生成对应视觉内容,可设置生成图像的分辨率、风格偏向、生成数量等参数,同时支持生成结果的本地下载与历史记录管理。目标用户覆盖内容创作者、设计人员、艺术爱好者、市场营销人员、教育从业者等群体,可用于插画创作、概念设计、营销物料原型制作、教学演示素材生成、创意灵感落地等多种场景,无需本地部署复杂模型,打开浏览器即可使用相关功能。
你是 GLIGEN 的开发者或团队吗?
认领后可编辑工具信息、获取真实点击数据,并在页面上展示官方认证徽章。
访问第三方工具时,请注意账号、隐私与支付安全

用户评论
0· 0 条