
写在前面欢迎大家关注Rocky的公众号WeThinkIn欢迎大家关注Rocky的知乎Rocky Ding《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book欢迎大家StarRocky最新撰写的10万字AI AgentAI智能体深入浅出全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识欢迎大家加入https://t.zsxq.com/33pJ0大家好我是Rocky。核心导读这篇论文叫MonkeyOCRv2: A Visual-Text Foundation Model for Document AIarXiv 编号是2607.11562作者在论文中提出了一个专门面向文档图像的视觉-文本基础模型 MonkeyOCRv2并构建了一个 113M 图像、覆盖 17 种语言的文档预训练语料 MonkeyDoc v2。Rocky 认为这篇论文真正值得讨论的并不是“又一个 OCR 模型把某个榜单刷高了”。更本质的变化是文档智能正在从“拿自然图像视觉编码器来凑合用”走向“为文字笔画、版面结构、阅读顺序、公式和表格专门训练视觉底座”。过去很多 Document AI 系统的底层视觉编码器来自 ImageNet、CLIP、DINO、SAM 这类自然图像或通用视觉模型。它们很强但强在对象、场景、区域边界、全局语义对齐而文档图像真正难的地方是极细粒度的字符差异、笔画结构、密集文本、版面关系、跨语言书写系统、公式符号和表格结构。两者不是同一种视觉统计。MonkeyOCRv2 的核心判断很直接文档不是“带很多字的图片”文档本身就是一种独立视觉模态。论文做了三件事构建 MonkeyDoc v2113M 文档图像样本17 种语言包含 8M 页级图像和 105M 裁剪文档元素。提出双目标预训练一边做 image-to-text generation让视觉表征对齐文本内容一边做 pixel-level document reconstruction让编码器保留笔画、字形和版式细节。在文本识别、公式识别、文本检测、文档篡改检测、重叠文本分割、文档解析、文档理解等任务上验证迁移能力。如果只看结果论文确实给了很亮眼的数字CRNN 的总体识别准确率从 58.7% 提升到 67.3%110M 的 UniMERNet-T MonkeyOCRv2 超过 325M 的 UniMERNet-B0.7B 的 MonkeyOCRv2-Parsing 在 MDPBench 上达到 83.3总体分数超过 3B dots.mocr 2.8 个百分点而且视觉编码器大约小 11 倍在受控文档理解比较中MonkeyOCRv2-B 达到 57.2超过 OpenVision-B 的 44.0 和 RADIOv2.5-B 的 37.5。但 Rocky 更关心的不是这些分数本身而是这些分数背后的机制当模型需要读清楚“眼睛看见的字”而不是根据语言常识猜测“这里大概是什么字”时文档原生视觉预训练的价值会明显放大。一、问题背景文档智能长期借用了一双“不适合读字的眼睛”很多人容易把 OCR 看成一个老问题文字识别嘛深度学习已经做了很多年剩下的只是工程细节。但从今天的 Document AI 看问题已经不再是单行文本识别那么简单。企业知识库、科研论文、法律合同、财报、病历、扫描票据、手写笔记、技术标准、低清拍照文档本质上都在把知识压缩进一种“视觉-文本混合结构”里。文档智能要做的也不只是把图像里的字转成字符串而是要同时处理字符级视觉辨别公式、表格和版式结构多语言、多脚本、多字体、多分辨率扫描、拍照、遮挡、弯曲、噪声、篡改阅读顺序和层级结构与语言模型衔接后的解析、问答和理解。这里真正尴尬的地方在于很多系统在视觉编码器上仍然沿用自然图像预训练模型。ImageNet 教会模型识别物体类别CLIP/SigLIP 强调图文全局语义对齐DINO 学跨视角稳定语义SAM 强在区域边界和可分割对象。它们对自然图像非常有效但这些目标天然会鼓励模型忽略局部细节。而文档图像恰恰相反。一个字母、一个数字、一个公式符号甚至一个笔画的微小差异都可能改变语义。0和O、1和l、阿拉伯语从右到左的阅读顺序、中文票据里的小号数字、公式里的上下标结构都不是高层语义可以轻易补回来的。这就是 Figure 1 想表达的 “representation mismatch”自然图像视觉模型把主要能力用在对象语义和区域边界上而 Document AI 需要的是字符笔画、字形细节、版面、阅读顺序和细粒度文本。Rocky 认为这个判断很重要因为它把文档智能从“应用层 OCR pipeline”重新推回到“基础模型预训练”层面。换句话说文档 AI 的瓶颈不只是解码器、不只是后处理规则也不只是再堆一个更大的 LLM而是视觉编码器本身是否真的学过文档。二、核心思路不是让模型更会猜而是让模型更会看MonkeyOCRv2 的技术路线可以压缩成一句话用大规模文档图像语料训练一个文档原生视觉编码器并通过“文本生成 图像重建”的双目标让它既理解文本语义又保留字符级视觉证据。这件事的关键不在“生成文本”本身。很多 OCR-free 或文档 VLM 也会做图像到文本生成。MonkeyOCRv2 更有意思的地方是把 pixel-level reconstruction 放进预训练目标里。直觉上如果只让模型从图像预测文本它可能会学会一种捷径当视觉信息不清楚时依靠语言上下文去补全。比如在英文句子中一个模糊的单词可以靠语境猜出来在表格或票据中一个常见字段也可能被语言先验补齐。短期看这会提升一些自然文本场景的准确率长期看它会制造“看不清但猜得像”的文档幻觉。而图像重建目标逼迫编码器保留更多底层视觉信息。论文中的预训练流程是给定输入文档图像I II视觉编码器先产生视觉 tokenz E v ( I ) \mathbf{z}E_v(I)zEv(I)视觉 decoder 尝试从这些 token 还原原图I ^ D v ( z ) \hat{I}D_v(\mathbf{z})I^Dv(z)基础像素重建损失是L p i x 1 3 H W ∥ I ^ − I ∥ 2 2 \mathcal{L}_{\mathrm{pix}}\frac{1}{3HW}\left\|\hat{\mathbf{I}}-\mathbf{I}\right\|_2^2Lpix3HW1I^−I22文本 decoder 则基于同一组视觉 token 自回归生成图像中的文字内容。最后总预训练目标是L p r e t r a i n L t e x t λ L r e c \mathcal{L}_{\mathrm{pretrain}}\mathcal{L}_{\mathrm{text}}\lambda\mathcal{L}_{\mathrm{rec}}LpretrainLtextλLrec这里的机制非常朴素但也非常本质文本生成目标负责“把图像和文本内容对齐”图像重建目标负责“别把笔画、字形、局部视觉证据丢掉”。论文还探索了更结构化的重建损失通过 Sobel 梯度构造软边缘图再用距离到边缘的结构图约束重建结果。这部分不是所有实验默认使用但在文档理解实验中带来了额外增益。它背后的思想依然是同一个文档图像里的边缘和笔画不是噪声而是信息本身。Rocky 认为这一点和很多通用 VLM 的训练偏好正好相反。通用视觉模型希望学到对光照、纹理、局部扰动不敏感的高层语义文档视觉模型则要在很多时候对局部扰动高度敏感。因为对文档来说“细节”不是干扰项而是答案所在。三、数据不是附属品MonkeyDoc v2 才是这篇工作的底层基础设施很多论文会把数据集描述写得像附录但 MonkeyOCRv2 里数据本身就是方法的一部分。MonkeyDoc v2 包含 113M 样本覆盖 17 种语言简体中文、繁体中文、英语、阿拉伯语、德语、西班牙语、法语、印地语、印尼语、意大利语、日语、韩语、荷兰语、葡萄牙语、俄语、泰语和越南语。其中 8M 是页级图像105M 是裁剪后的文档元素。真实样本 61M占 54%合成样本 52M占 46%。论文把数据构建拆成三块第一专家模型标注。它不是依赖单个 OCR 模型而是用多个互补专家模型独立转写再通过预测之间的相似度选择平均一致性最高的标签。这种方式的目标是降低单个模型的偏置和系统性错误。第二多语言语料合成。作者从覆盖 17 种语言的 LLM 语料中采样文本结合字体、样式、分辨率渲染成图像对低频字符和稀有符号还会抽取完整字符集做随机组合渲染表格数据则结合真实模板和自动生成结构公式部分从 arXiv 论文中收集公式并渲染大约形成 0.8M 公式样本。第三数据过滤。对于报纸、手写笔记等复杂来源作者用版面检测结果遮挡已检测区域再让强文档多模态模型判断是否仍能识别残余文字如果能说明布局标注可能漏检。阅读顺序也会通过文本拼接后的逻辑一致性来过滤。最终来自这些挑战来源的 1.2M 初始页面中约 0.9M 被保留。从数据规模上看论文给出的对比也很直观模型 / 数据数据规模数据类型语言覆盖CLIP400M自然图像N/ASigLIP 240B自然图像N/ASAM11M自然图像N/ADINOv2142M自然图像N/AoCLIP450K场景文本图像2DiG35.6M场景文本图像1DiT42M扫描文档1Donut13M扫描 / 合成文档4Pix2Struct80M网页截图1MonkeyOCRv2113M多类型文档17这张表的意义不是简单说 MonkeyOCRv2 数据最大。SigLIP 2 的数据规模远大于 113M但那是自然图像不是文档图像。真正的差异在于数据分布和监督密度文档智能需要的是密集文本、布局结构、公式表格、多语言字符和视觉细节而不是自然场景里的对象语义。Rocky 认为这里真正有跨周期价值的是“数据引擎”而不是某个单点模型权重。文档智能如果要进入企业知识、科研、金融、法律、医疗这些高价值场景最终竞争不会只发生在 decoder 规模上而会发生在谁能持续构建高质量、多语言、结构化、可过滤、可迭代的文档视觉数据资产上。四、实验结果强的不是一个任务而是跨任务迁移MonkeyOCRv2 的实验设计有一个很清楚的思路它不是只做一个端到端文档解析模型而是把视觉编码器迁移到多个已有系统里看替换 backbone 后是否稳定提升。这点很关键。因为如果一个新系统只在自己的 pipeline 上好可能是任务后处理、训练数据或解码策略的贡献但如果同一个视觉编码器被替换进文本识别、公式识别、检测、篡改定位、分割、解析、理解等任务后都有效就更能说明它学到的是通用的文档视觉表征。论文中的关键结果可以压缩成下面这张表任务论文中的主要证据Rocky 解读文本识别CRNN 总体准确率 58.7% → 67.3%PARSeq MonkeyOCRv2 达到 84.3低配识别器也能显著受益说明 encoder 本身提供了更强字符级视觉表征公式识别110M UniMERNet-T MonkeyOCRv2 总体 ExpRate 66.4超过 325M UniMERNet-B 的 64.5公式不是自然语言靠局部结构和二维关系视觉底座比单纯扩大模型更关键文本检测在 ICDAR2015、ArT、Total-Text、CTW1500 上多模型稳定提升文档原生表征不仅服务识别也能迁移到定位与多尺度边界任务篡改检测FFDN MonkeyOCRv2-AS 总体 IoU 78.2、F1 87.5高于 ViTAEv2 版本篡改检测需要捕捉细粒度视觉伪影重建式预训练天然有帮助重叠文本分割MOT 数据集上 mIoU 提升论文概览给出 5.3对遮挡、重叠、笔画边界的分割依赖的不只是语义而是像素级细节文档解析MDPBench 上 MonkeyOCRv2-B-Parsing 达到 83.3高于 dots.mocr 80.5frozen encoder 轻量 LLM 仍能赢说明视觉侧贡献足够强文档理解受控比较中 MonkeyOCRv2-B 达到 57.2高于 OpenVision-B 44.0在相同 LLM、训练数据和流程下只换视觉编码器仍显著提升这张表里最值得看的是两个“反直觉”结果。第一个是公式识别。论文里 110M 的 UniMERNet-T 换上 MonkeyOCRv2-S 后总体 CDM 达到 90.9、ExpRate 达到 66.4而 325M 的 UniMERNet-B 是 89.5 和 64.5。这说明在公式这种高结构、强视觉细节任务上更合适的视觉编码器可以弥补模型容量差距。第二个是文档解析。MonkeyOCRv2-B-Parsing 是一个 0.7B 模型视觉编码器约 0.1B在 MDPBench 上拿到 83.3超过 3B dots.mocr 的 80.5。论文强调它的视觉编码器大约比 dots.mocr 小 11 倍。这里不能简单解读为“参数越小越好”但至少说明一件事如果视觉底座学对了文档分布后面的语言模型不一定要无限堆大。Rocky 认为这也是 Document AI 工程落地里非常现实的点。企业不一定永远愿意为文档解析调用超大 VLM尤其是有大量合同、发票、投研报告、病历、合规材料需要批处理时。一个更强的文档视觉 encoder可能意味着更小的模型、更低的成本、更可控的延迟以及更少的语言幻觉。五、最有价值的实验把语言上下文拿掉看模型还会不会读这篇论文最有意思的部分不是常规 benchmark而是对语言上下文依赖的分析。高准确率并不总等于强视觉能力。一个文档模型可能不是“看清楚了”而是“猜对了”。当一句话语义连贯、上下文强时语言模型可以补很多东西但真实文档场景里我们经常面对的是编号、金额、公式、序列号、人名、地址、表格字段、扫描噪声和非自然语言片段。这里如果模型靠猜就会出事。论文设计了一个 scrambled text 实验把文本字符打乱破坏自然语言上下文让模型更依赖视觉证据。同时逐步降低输入分辨率从 1288 降到 448观察 scrambled-text recognition accuracy 和语义文本 / scrambled 文本之间的准确率差距。结果很有解释力对 MonkeyOCRv2-S-Parsing如果没有重建目标scrambled-text accuracy 从 99.7% 降到 55.4%下降 44.3 个百分点。加入重建目标后最低分辨率 448 下仍有 72.1%下降缩小到 27.6 个百分点。在 448 分辨率下语义文本与 scrambled 文本之间的差距从无重建的 29.3% 缩小到有重建的 15.3%。论文也很谨慎地说明这个 gap 只是语言上下文依赖的 operational proxy不是完整的幻觉度量因为字符打乱会引入分布偏移也可能影响 tokenization 和 decoding。这个边界要讲清楚。Rocky 不认为一个 scrambled 实验就能完全证明模型“不幻觉”。但它提供了一个非常有价值的方向评价文档模型时不应该只看它在自然文本里的转写准确率还要看它在语言先验失效时是否仍然忠于视觉证据。这和企业场景非常相关。合同编号、账户数字、实验参数、药品剂量、财务金额、公式符号本来就不是靠语言常识能安全补全的内容。模型在这些地方“猜得顺”反而危险。论文进一步用 CHAOS-Bench 检验视觉证据和语言先验冲突时的忠实度。MonkeyOCRv2-B-Parsing 的 page-average recall 达到 17.9高于 HunyuanOCR-1.5 的 14.2也明显高于 PaddleOCR-VL-1.6 的 6.0。MonkeyOCRv2-S-Parsing 加入重建目标后从 baseline 的 12.1 提升到 14.7。Figure 6 和 Figure 7 的质性对比也很直观。阿拉伯语文档里阅读顺序是右到左模型如果只是“泛化地理解文本”很容易在顺序上犯错中文拍照说明书里表格结构、局部遮挡、拍照畸变都会放大视觉编码器差异。这类例子对产业落地很有启发Document AI 真正难的不是 demo 里识别一页清晰 PDF而是对低质、多语言、复杂版式、关键字段保持忠实。六、文档理解同一个 LLM 下只换视觉 encoder 还能提升多少为了隔离视觉编码器的贡献论文在文档理解任务里做了一个很重要的受控比较所有视觉编码器都接同一个 Qwen3-1.7B LLM训练数据、优化流程、解码设置保持一致视觉 encoder 冻结只看不同 encoder 的影响。结果非常直接视觉编码器参数量8 个文档理解 benchmark 平均分CLIP-B86M16.0SigLIP 2-B93M24.9DINOv3-B86M16.1SAM-B90M25.2OpenVision-B87M44.0RADIOv2.5-B98M37.5MonkeyOCRv2-S baseline28M50.7MonkeyOCRv2-S MSE only28M51.7MonkeyOCRv2-S 结构化重建28M55.9MonkeyOCRv2-B 结构化重建113M57.2这里最有说服力的是CLIP、DINO、SAM 这些在通用视觉领域非常强的模型在文档理解受控设置下并不强。原因不是它们“不聪明”而是它们的训练目标没有把字符级视觉证据当成第一等公民。Figure 8 展示的例子很典型通用视觉模型能看出图像大概是什么但在数字、姓名、电话号码、中文标签等精确文本上容易出错。Document AI 不只需要“知道这是一张表”还要读准表里的每一个关键字段。Rocky 认为这里有一个对 AI 产品团队很重要的判断在文档场景里模型能力不是“大语言模型 任意视觉塔”的简单叠加。视觉塔如果没有文档原生能力后面的 LLM 会被迫承担太多本不该由语言先验承担的工作。这会带来三个产品后果准确率瓶颈会卡在视觉侧而不是提示词侧。幻觉风险会以“看起来合理的错误字段”形式出现。成本会被迫向更大模型转移但更大 LLM 未必能弥补视觉证据缺失。七、这篇工作的边界它不是万能文档解析系统而是文档视觉底座严谨地看MonkeyOCRv2 也有明显边界。第一论文的 MonkeyOCRv2-Parsing 采用的是比较克制的监督微调流程并且视觉 encoder 冻结没有使用一些领先专用解析系统里的渐进后训练和复杂工程策略。因此在 OmniDocBench 这类相对饱和的 benchmark 上它仍然落后于 GLM-OCR、MinerU2.5-pro、PaddleOCR-VL-1.6、HunyuanOCR-1.5 等更强的专用解析系统。这不是一个小问题。它说明 MonkeyOCRv2 不是“一个模型解决全部文档解析”的故事。它更像一个强视觉底座能让不同系统受益但完整产品仍然需要 layout 策略、区域 refinement、后处理、任务数据、延迟优化和工程闭环。第二文档解析架构本身偏自回归逐元素识别更利于准确率和结构保真但不一定利于低延迟部署。大规模企业批处理场景里吞吐和成本会成为非常现实的约束。第三论文证明了 reconstruction-aware objective 有价值但还没有完全拆开 decoder 设计、重建权重 schedule、结构化损失各部分的独立贡献。这意味着后续仍需要更系统的消融。第四尽管 MonkeyDoc v2 覆盖 17 种语言但论文也承认数据仍偏向高资源文字系统。低资源语言、历史文字、特殊行业文档的覆盖仍然是未来问题。Rocky 认为这些边界并不削弱论文价值反而让它的位置更清楚MonkeyOCRv2 的价值不是宣称端到端文档解析终局而是证明“文档原生视觉预训练”本身可以成为 Document AI 的基础设施层。八、对产业的启发Document AI 的竞争会从“会不会 OCR”转向“能不能忠实读复杂知识载体”文档智能是一个非常容易被低估的方向。因为“识别文字”听起来像旧任务没有生成视频、Agent、世界模型那么性感。但在产业一线文档是知识、流程和交易的主要载体。企业里面大量有价值的信息不在结构化数据库里而在 PDF、扫描件、合同、报表、检测报告、财务票据、医疗文书、会议纪要、工程图纸、技术标准里。AI 如果不能稳定理解这些文档就很难真正进入企业核心流程。从这个角度看MonkeyOCRv2 提供的不是一个单点 OCR 工具而是一种 Document AI 基础设施路线先承认文档图像是一种独立视觉分布再用大规模、多语言、多类型、高密度标注的文档语料训练视觉底座用文本生成对齐语义用图像重建保留视觉证据让这个视觉底座迁移到识别、检测、分割、解析、理解多个任务最后接入轻量或中等规模 LLM形成更低成本、更可控的文档智能系统。这件事真正给 Rocky 的启发是AI 应用的下一阶段不一定只是把更大的通用模型塞进更多场景而是为高价值场景构建更专业的数据、感知和工作流底座。通用模型会继续变强但产业落地不会只奖励“谁调了最大模型”。很多时候真正有商业闭环的项目来自对某个复杂场景的视觉统计、数据资产、可靠性边界和交付流程的深刻理解。Document AI 就是这样的场景。九、给不同读者的建议对算法工程师来说这篇论文值得学习的不是某个单一 benchmark而是它的研究问题定义不要默认通用视觉 encoder 足够好要先问目标场景的视觉统计是否一致。文档图像要求字符级保真自然图像预训练目标未必合适。对多模态团队来说MonkeyOCRv2 提醒我们VLM 不是“LLM 视觉塔 projector”这么简单。视觉塔学到什么决定了后续语言模型是在读证据还是在用语言先验补洞。对企业 AI 产品来说这篇论文的商业含义是文档智能的价值不在 demo而在忠实、稳定、可审计地处理复杂文档。如果模型把合同编号、金额、药品剂量、公式参数“猜顺了”那不是智能是风险。对创业者和投资人来说Rocky 会关注两类能力一类是能持续构建高质量文档数据资产和评测体系的团队另一类是能把文档视觉底座接入真实业务流程、形成成本与可靠性优势的团队。单纯包装一个 OCR API不会形成长期护城河。十、结论文档不是自然图像的附庸文本本身正在成为第一等视觉模态MonkeyOCRv2 的核心贡献可以用一句话概括它把 Document AI 的底层问题从“怎么让模型读文档”推进到“文档视觉本身应该如何预训练”。这不是一个小变化。在过去的技术周期里很多文档系统默认借用自然图像视觉编码器再靠任务微调、规则后处理和更大的语言模型补齐能力。MonkeyOCRv2 的结果说明这条路并不总是最优。文档图像里的字、公式、表格、版面和阅读顺序本身就需要一套文档原生视觉表征。Rocky 认为MonkeyOCRv2 的长期价值不在于某一个榜单分数而在于它明确提出并验证了一个方向文本不是附着在图片上的语义标签而是一种需要被视觉模型认真学习的结构化视觉信号。工具会迭代模型会换代榜单会刷新。但这种对问题本质的重新定位往往更有跨周期价值。推荐阅读Rocky一直在运营技术交流群WeThinkIn-技术交流群这个群的初心主要聚焦于技术话题的讨论与学习包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛欢迎大家入群一起学习交流请添加小助手微信Jarvis8866拉你进群1. 深入浅出完整解析AI AgentAI智能体的核心基础知识2025年可以说是AI Agent全面落地应用的元年因此Rocky在持续撰写对AI Agent的全维度解析文章深入浅出完整解析AI AgentAI智能体的核心基础知识2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解同时不断跟进补充扩散模型的最新技术发展希望能给大家带来帮助深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识3. 入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识Rocky对AIGC时代“中场时刻”之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值入浅出完整解析FLUX.2、Seedream即梦、Z-image、GLM-Image核心基础知识4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识5. 深入浅出完整解析DeepSeek系列核心基础知识Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析深入浅出完整解析DeepSeek系列核心基础知识6. 深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion 3SD 3和FLUX.1系列核心基础知识7. 深入浅出完整解析Stable Diffusion XLSDXL核心基础知识Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析深入浅出完整解析Stable Diffusion XLSDXL核心基础知识8. 深入浅出完整解析Stable DiffusionSD核心基础知识Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析深入浅出完整解析Stable DiffusionSD核心基础知识9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析包括其在传统深度学习中的价值和在AIGC中的价值深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识10. 深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识对于AIGC时代中的“ResNet”——LoRA模型Rocky进行了深入浅出的全面讲解深入浅出完整解析LoRALow-Rank Adaptation模型核心基础知识11. 深入浅出完整解析ControlNet核心基础知识AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。ControlNet正是让AI图像创作社区无比繁荣的关键一环它让AIGC图像创作过程更加的可控更有助于广泛地将AIGC算法解决方案应用到各行各业中深入浅出完整解析ControlNet核心基础知识12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识AI绘画和AI视频是两个互相促进、相互交融的领域2024年无疑是AI视频领域的爆发之年Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识13. 深入浅出完整解析AIGC时代Transformer核心基础知识在AIGC时代中Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向成为AI技术架构大一统与多模态整合的关键核心基座大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析深入浅出完整解析AIGC时代Transformer核心基础知识14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识AIGC创作框架正是AIGC算法工作流的运行载体目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等。在传统深度学习时代PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架到了AIGC时代Rocky相信ComfyUI就是AIGC时代的“PyTorch”、Stable Diffusion WebUI就是AIGC时代的“TensorFlow”、Diffusers就是AIGC时代的“Caffe”深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识在AIGC时代中如何快速转身入局AIGC产业如何成为AIGC/LLM/AI Agent算法/开发工程师如何在学校中系统性学习AIGC/LLM/AI Agent知识斩获心仪的AIGC/LLM/AI Agent算法/开发offerDon‘t worryRocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍为大家答疑解惑希望能给大家带来帮助手把手教你成为AIGC/LLM/AI Agent算法/开发工程师斩获AIGC/LLM/AI Agent算法/开发offer16. AIGC产业的深度思考与分析2023年3月21日微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示自从1980年首次看到图形用户界面graphical user interface以来以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。Rocky也认为AIGC及其生态会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期未来随着AIGC的全面落地和深度商用会深刻改变我们的工作、生活、学习以及交流方式各行各业都将被重新定义过程会非常有趣。那么在此基础上我们该如何更好的审视AIGC的未来我们该如何更好地拥抱AIGC引领的革新Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点希望能帮助各位读者对AIGC有一个全面的了解深入浅出全面解析AIGC时代核心价值与发展趋势2025年版17. AI算法工程师的独孤九剑秘籍为了方便大家实习、校招以及社招的面试准备同时帮助大家提升扩展技术基本面Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍持续更新中18. 深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识GAN系列模型作为传统深度学习时代的最热门生成式Al模型在AIGC时代继续繁荣作为Stable Diffusion/FLUX系列大模型的“得力助手”广泛活跃于AlGC图像创作的产品与工作流中深入浅出完整解析AIGC时代中GANGenerative Adversarial Network系列模型核心基础知识