DeepSeek-OCR-2 DeepEncoder V2如何工作Qwen2双注意力与CLIP视觉编码器终极对比解析【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是 DeepSeek 开源的文档 OCR 模型其核心升级是全新的视觉编码器DeepEncoder V2用 Qwen2 语言模型解码器替换旧版 CLIP ViT通过「非因果 因果」双注意力实现视觉因果流Visual Causal Flow配合动态分辨率将图片精准解析为 Markdown 文本。本文带你从源码层面拆解它如何工作并与 CLIP 视觉编码器做逐项对比。 为什么用语言模型替换 CLIP 视觉编码器上一代 DeepEncoder 的视觉链路是80M 16x Tokenizer CLIP ViT 300M全程使用非因果注意力双向注意力。CLIP 的预训练目标是「图文匹配」它的特征擅长描述图里有什么却没有固定的阅读顺序——对段落、表格、公式这类强顺序的文档内容天然表达力不足。DeepEncoder V2 的思路非常直接LM as Vision Encoder用语言模型当视觉编码器——把 Qwen2-0.5B约 500M 参数的解码器接在视觉特征之后并引入一组可学习查询learnable query让视觉特征按照新的阅读顺序被逐个读出这就是论文标题Visual Causal Flow的由来。左图是旧版 DeepEncoderCLIP ViT 300M纯非因果注意力右图是 DeepEncoder V2Qwen2 500M 可学习查询非因果 因果双注意力。 DeepEncoder V2 总体结构图像到视觉 Token 的四步链路在 vLLM 推理入口 deepseek_ocr2.py 中视觉主干的调用顺序一目了然sam_model → qwen2_model → projector对应四个环节SAM ViT-B 特征提取—— sam_vary_sdpa.py 中的 12 层 ViT-B大部分层用窗口注意力窗口 14 个 patch控制计算量第 2/5/8/11 层用全局注意力打通长程依赖随后经 neck 与两级 stride-2 卷积256→512→896 通道把 1024×1024 图像压缩成16×16×896的特征图实现 16 倍面积压缩。Qwen2 解码器当编码器用—— qwen2_d2e.py 构造了 24 层、hidden 896、14 头GQA2 个 KV 头的 Qwen2 主干并删除了embed_tokens直接以图像特征作为输入嵌入。可学习查询拼接—— 模型内置两组查询嵌入query_768144 个和query_1024256 个按输入分辨率自动选用拼接到图像 patch 特征之后。线性投影对齐—— build_linear.py 的MlpProjector用单层线性层把 896 维特征投到 1280 维对齐语言模型词表嵌入空间。⚡ 核心机制Qwen2 双注意力非因果 因果如何协同这是 DeepEncoder V2 最精妙的设计。Qwen2Decoder2Encoder.forwardqwen2_d2e.py给每个 token 发一个token_type_ids0 图像 patch → 非因果图像块之间互相全见可以双向整合整页上下文——相当于人眼先扫一眼整页。1 可学习查询 → 因果每个查询只能看到所有图像 patch 自身及前面的查询——相当于按顺序一行一行读。在_create_custom_4d_maskqwen2_d2e.py中这张自定义 4D 掩码正是如此构建的图像位置之间互相置 0开放而每个文本查询位置按text_positions[:i1]逐步开放。最后只取查询部分的输出y[:, n_query:, :]注释直接写明causal flow query得到一组带顺序的视觉 Token。 换句话说图像内部无偏互看读取过程严格单向。因果链强制特征按固定阅读顺序流动文档的段落结构、表格行列顺序因此得以被视觉 Token 天然编码——这就是视觉因果流。注意由于需要自定义注意力掩码该模块明确要求使用sdpa或eager实现不支持flash_attention_2qwen2_d2e.py。⚖️ DeepEncoder V2 vs CLIP 视觉编码器逐项对比对比维度DeepEncoder V1CLIPDeepEncoder V2Qwen2骨干网络CLIP ViT约 300MQwen2-0.5B 解码器约 500M注意力模式纯非因果双向非因果patch 因果query双模式可学习查询无144768 图/ 2561024 图阅读顺序无固定顺序新阅读顺序causal flow特征维度768896 → 投影至 1280位置编码绝对位置 相对位置RoPErope_theta1e6预训练目标图文匹配语言建模顺序依赖文档顺序建模弱强因果链天然表达对比要点V2 并没有更大就是更好而是借语言模型的归纳偏置——Transformer 解码器的因果结构本来就是为序列生成的把它反过来用来读图恰好补齐了 CLIP 缺失的顺序先验。️ 动态分辨率小图省 Token大图保细节DeepEncoder V2 与动态分辨率切块策略绑定工作image_process.py全局视图1 张 1024×1024BASE_SIZE产出256个视觉 Token负责版面全局理解局部视图按dynamic_preprocess自动切 (0~6) 块 768×768IMAGE_SIZE切块数由 config.py 的MIN_CROPS2/MAX_CROPS6约束每块产出144个 Token负责文字细节默认 Token 预算(0~6)×144 256个视觉 Token——小图只付 256复杂长文档最多约 1120在显存与精度之间取得平衡。 快速上手三种推理方式环境要求CUDA 11.8 PyTorch 2.6.0 vLLM 0.8.5见 README.md 与 requirements.txt。单图流式输出vLLM运行 run_dpsk_ocr2_image.pyPDF 并发解析vLLM运行 run_dpsk_ocr2_pdf.pyTransformers 推理运行 run_dpsk_ocr2.py两条常用提示词可在 config.py 切换文档转 Markdownimage|grounding|Convert the document to markdown.纯 OCR无版面imageFree OCR.更完整的架构论证可参考论文 DeepSeek_OCR2_paper.pdf。 总结DeepEncoder V2 的本质把 Qwen2-0.5B 解码器倒装成视觉编码器图像特征先入、查询后接双注意力是灵魂patch 间非因果互看整合全局query 间因果推进建立阅读顺序输出即视觉因果流对比 CLIP 的升级参数 300M→500M新增可学习查询与顺序先验更贴合文档级 OCR工程红利与 (0~6)×768 1×1024 动态分辨率组合视觉 Token 预算可控单图/整本 PDF 都能高效解析。理解了这套机制你就能明白 DeepSeek-OCR-2 为何能以更紧凑的视觉 Token把复杂文档读得又快又准。【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
Atlas 300V 24G推理卡实战:从PyTorch到YOLO部署全流程 做AI应用落地的人,这两年应该没少听过“atlas”这个名字。尤其当你在跑目标检测、视频结构化这类业务,手里正好捏着几个YOLO模型,又不想把推理压力全压在GPU上时,Atlas这个系列的推理卡就会频繁出现在选择列表里。最近群里也总有人… · 2026/9/26 19:18:19
AI能替代电机瞬态动力学仿真吗?能辅助但别全信 前两天有个做电机控制的同事问我:“AI现在这么热火朝天,电机瞬态动力学仿真这活儿,AI到底能做到什么程度?能不能直接甩给它?”我愣了一会儿,因为这问题看着简单,其实一句话回答不清楚。搞过电机… · 2026/9/26 19:18:19
OA审批流数据库设计:表结构拆分与流转落库实战 简介:这份PDF文档面向企业信息化建设者、后端开发与数据库设计人员,聚焦OA系统中流程审批模块的数据库建模问题,帮助读者理清审批流程从发起到归档的完整数据支撑思路。内容围绕流程实例表、活动实例表、审批任务表、规则配置表、历史版本表以… · 2026/9/26 19:18:19
室内人头检测YOLOv8数据集927张图训练实践与避坑指南 简介:面向yolo系列目标检测算法学习者与室内监控场景开发者,该数据集包含927张室内人头检测图像及完整标注,可直接用于yolov5、yolov7、yolov8、yolov9、yolov10、yolo11等主流模型的训练与验证测试。压缩包共2000个文件,包含927个… · 2026/9/26 20:03:03
退款承诺何时算数、何时不算?2026 逐条对照兑现条件边界,平台保障一次讲清 平台的退款承诺,是一份带条件的约定,而非一句笼统的保证。它写清了三件事:触发指标只认重复比例与 AIGC 检出比例,判断依据必须来自官方检测通道,审核周期为退款审核1-3个工作日。把这三件事看透,你才能判断… · 2026/9/26 20:02:55
Atlas 300V 24G上部署YOLO:从硬件认知到工程化落地全流程 我拿到这台服务器时,里面插着的正是Atlas 300V 24G。当时项目要求在这张卡上把YOLO跑起来,我在搜索引擎里也看到不少人问“atlas 300v 24g 是运算加速卡吗”。这里统一回答:它确实是运算加速卡,而且是一张专职干AI推理的加速卡&am… · 2026/9/26 20:02:55
用AI重构个人工作流:我如何把每天2小时的信息筛选压缩到10分钟 每天早上9点,我的第一件事不是写代码,而是——刷信息。打开浏览器,依次访问5个招标公告网站,手动翻找与团队业务相关的政策动态和项目机会。然后打开3个行业资讯站,筛选有价值的技术趋势。最后,把认为“可能… · 2026/9/26 20:02:55
侧动式跳汰机|中粗粒重选核心装备,脉动分层提升重矿物回收效率 侧动式跳汰机|中粗粒重选核心装备,脉动分层提升重矿物回收效率在重力选矿体系中,跳汰选矿依托矿物间比重差异实现分选,是应用历史久、经济性突出的重选工艺。侧动式跳汰机作为跳汰设备主流机型之一,依靠独特的侧部脉动… · 2026/9/26 20:02:55
AI编程工具ZCode被曝后台静默上传代码与Git历史,实测排查全过程 1. 事件背景与排查动机1.1 一个让我后背发凉的发现事情起因很简单。上周三晚上,我在给一个客户做代码审计的间隙,顺手打开网络监控面板看了一眼。结果发现一个让我瞬间清醒的现象:我的开发机上,一个AI编程工具的进程正在持续向外部… · 2026/9/26 20:02:55
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍 简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践 一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46