ControlNet究竟是什么鬼?
发表于|更新于|学习
|浏览量:
我们有玩过Stable DIffusionffusion的应该对这个不陌生,比如通过OpenPose可以控制我们生成图片人物的姿态。那么ControlNet究竟是怎么工作的呢?首先,我们得知道Stable Diffusion本身的工作方式就是…
相关推荐
2024-11-29
怎么通俗的理解Diffusion model?
扩散模型(Diffusion Model)是当前AI图像和视频生成(如Stable Diffusion、Midjourney、DALL-E)背后的核心技术。通俗理解,扩散模型的原理可以这样想象:先用一张完整图片,逐步添加噪声直到完全变成随机噪点(前向过程),然后训练AI学会”逆向操作”——从纯噪点一步步去噪,最终还原出清晰图片(反向过程)。当模型学会了去噪,给它任意随机噪点就能生成全新的图片。本视频用最通俗的方式帮你理解这一复杂概念。
2024-11-29
最新Stable Diffusion 3.5 Large Turbo
Stable Diffusion 3(SD3)是Stability AI推出的最新一代文生图模型,采用了全新的MMDiT(多模态扩散Transformer)架构。相比于SDXL,SD3在图像质量、提示词理解、文字渲染和面部生成方面都有质的飞跃。它支持多种分辨率输入,生成的图片在不同比例下都能保持高质量。SD3有多个版本(从8亿到80亿参数),适应从消费级GPU到企业级服务器的不同部署需求。本视频测评SD3的实际效果和性能表现。 访问入口

2025-01-28
DeepSeek Janus:横扫海内外文生图模型
DeepSeek这两天才通过它的R1推理大语言模型横扫海内外LLMs,刚刚又推出了免费的多模态模型Janus-Pro-7B,不但能很好的理解图片,还能生成质量很高的图片。根据海外的评测,在GenEval和多个benchmarks几百了Stable Diffusion和OpenAI的DALLE-3。 废话不多说,我们赶紧去Demo下… 访问入口

2025-03-02
DeepSeek文生图:实现和工作原理!
免费DeepSeek文生图啊!我们知道DeepSeek本身不是一个多模态模型,也就是说模型本身是不支持图片等的输入和输出的。这么好的一个文本生成模型不能直接生成图片,着实有点可惜。但是也不是不可为,这里跟大家说个技巧,通过直接交deepseek生成一个文生图的提示词,然后叫它填写到一个可以url中,我们就可以生成图片了,这样我们就能结合deepseek强大的文本能力以及第三方免费的文生图能力了。 这里的url其实就是第三方的一个文生图服务,叫做pollination的免费AI工具,我们只需要在它提供url,事实上就是一个http的api,url上提供文生图提示词就能能生成图片了… DeepSeek访问入口 Pollinations访问入口
2024-11-29
Forge UI:Stable Diffusion最新免费客户端
Forge UI是Stable Diffusion的一款现代化免费客户端,专为追求高性能和丰富功能的用户设计。相比于Automatic1111的WebUI,Forge UI在内存优化、生成速度和功能扩展方面都有显著提升。它支持最新的SDXL、SD3和FLUX模型,提供了更清晰的界面布局、更快的图像生成速度和更低的显存占用。对于Stable Diffusion的进阶用户来说,Forge UI是一个值得尝试的客户端选择。 访问入口
2024-11-29
CLIP:怎么评判文生图质量的好坏?
CLIP(Contrastive Language-Image Pre-training)是OpenAI开发的跨模态模型,它能够将文本和图片映射到同一个向量空间,从而衡量文本描述与图片内容的匹配程度。在文生图领域,CLIP常被用作自动评估工具——当AI生成一张图片后,可以用CLIP计算”提示词”与”生成图片”之间的相似度分数,以此评判文生图的质量和一致性。CLIP打分的优点在于速度快、可重复,不需要人工评价。但它的局限性也同样明显:CLIP分数高并不一定代表人类觉得好,因为审美、创意、情感等主观因素很难被量化。本视频带你全面了解CLIP的原理及其在文生图评估中的正确使用方式。
公告





