Omost 上手指南:让 LLM 替你写代码画图

发布时间:2026/9/20 15:55:18
Omost 上手指南:让 LLM 替你写代码画图 Omost 上手指南让 LLM 替你写代码画图【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/Omost提示词调了半小时出来的图还是差口气主体位置不对背景抢戏改一个词整张图跟着变。问题不在你而在于传统 AI 绘图模型只吃一句话。Omost 换了个思路让 LLM 直接写代码做图像生成把整张图的布局一行行搭出来再渲染成真实图片。30 秒跑起来前提一台带 NVIDIA 显卡的机器8GB 显存起步。然后三条命令git clone https://gitcode.com/GitHub_Trending/om/Omost cd Omost pip install -r requirements.txt python gradio_app.py跑完之后你会看到什么浏览器里开出一个 Gradio 聊天界面。左边跟它说话中间是 LLM 生成的 Canvas 代码点一下渲染按钮右边出图。第一次跑会自动下载模型卡一会儿很正常别以为它挂了。它是怎么画图的三步走那它到底怎么把一段话变成一张图的把这条从 Canvas 图像合成到出图的链路拆开就三步。第一步LLM 生成图像代码。你说左边战士、中间喷火的龙、上方雷暴天空LLM 不会回你一句提示词而是回你一段 Python 代码先给整张图定一个全局描述再给每个元素加一条局部描述——在哪个位置、离镜头多远、占多大区域、什么颜色。第二步Canvas 把代码变成布局稿。你可以把 Canvas 想成一张草稿纸。代码在上面跑完产出两样东西一张用位置和颜色画出的粗糙色块图远看就是构图外加一组区域条件每个区域一张遮罩加一段独立的文字描述。Canvas 的源码在 lib_omost/量不大想看懂半天就够。第三步Pipeline 当打印机渲染成真图。Stable Diffusion XL 文生图管道接住这些条件在扩散的每一步里让每个区域的像素只听自己那段描述的话画面一步步清晰。说白了草稿纸决定画什么、画在哪打印机负责出高质量成品。还有个顺手的玩法不满意就接着聊。一句把龙换成恐龙LLM 只改写那一段代码你点一下渲染新图就来。实际能玩出什么花样多元素合成是它的主场。传统提示词里三个战士加龙加雷暴容易搅成一锅Omost 给每个元素分配独立区域和前后关系构图稳得住。对话式编辑是另一个有意思的点不用整张重抽。海报这次要改个文案改完代码一目了然渲染对比也快。它也更适合干活的场景产品图、信息图、拼贴合成。布局是用代码描述的位置、大小、图层顺序都是显式参数——logo 放左上角、产品放正中从许愿变成了配置。而且代码可读你手动改一个深度值、一个颜色立刻能看到画面怎么变。这种 LLM 绘画的工作流顺便也是个很好玩的调试过程。技术亮点 后续演进基线渲染器直接操作扩散模型的交叉注意力分数一个无参数公式不训练任何额外模型因此基本不带风格偏移也不掉画质。文本编码用了子提示词贪心合并每段小描述语义独立且不超过 75 个 token编码器不会把句子拦腰截断。团队也提到未来可能探索参数化的方向进一步提质量和效率。一句话评价然后去跑与其说 Omost 是个画图工具不如说它把画画变成了写代码——而这恰好是 LLM 最擅长的事。仓库地址就在上面那条 clone 命令里去把第一张图跑出来吧看看这位会写代码的画家能给你画什么。️【免费下载链接】OmostYour image is almost there!项目地址: https://gitcode.com/GitHub_Trending/om/Omost创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考