首页/新闻资讯/正文详情

DeepSeek-OCR-2快速上手:10行代码如何把任意文档图片精准转成Markdown

发布时间:2026/9/27 7:56:07 来源:云帆数科 栏目:资讯中心
DeepSeek-OCR-2快速上手:10行代码如何把任意文档图片精准转成Markdown
DeepSeek-OCR-2快速上手10行代码如何把任意文档图片精准转成Markdown【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是一款开源的深度学习 OCR 工具Visual Causal Flow 架构只需 10 行代码即可将文档图片、PDF 精准转换成 Markdown 格式支持动态分辨率与高并发批量识别对新手非常友好。一、DeepSeek-OCR-2 是什么DeepSeek-OCR-2 的核心思想是像人一样阅读它通过视觉因果流按人类视觉习惯的顺序编码图片内容并采用动态分辨率——默认最多将图片切分为 (0-6) 块 768×768 区域加 1 块 1024×1024 缩略图只消耗 144256 个视觉 token既省显存又保精度。相比传统 OCR它最大的优势是 直接输出结构化 Markdown标题、表格、公式、图片位置一应俱全️ 自动切出文档中的插图并引用⚡ 支持图片流式输出、PDF 高并发批量转换二、一键安装三步配好OCR环境官方环境为 CUDA 11.8 torch 2.6.0按 README 操作只需三步# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 # 2. 创建 Python 3.12 环境 conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2 # 3. 安装依赖vllm-0.8.5 的 whl 包需先下载 pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl pip install -r requirements.txt pip install flash-attn2.7.3 --no-build-isolation其余依赖Pillow、PyMuPDF、numpy 等都列在 requirements.txt 中。三、10行代码单张图片转Markdown最快的体验路径是 Transformers 推理直接参考 run_dpsk_ocr2.py核心只有 10 行from transformers import AutoModel, AutoTokenizer import torch model_name deepseek-ai/DeepSeek-OCR-2 tokenizer AutoTokenizer.from_pretrained(model_name, trust_remote_codeTrue) model AutoModel.from_pretrained(model_name, _attn_implementationflash_attention_2, trust_remote_codeTrue, use_safetensorsTrue) model model.eval().cuda().to(torch.bfloat16) prompt image\n|grounding|Convert the document to markdown. res model.infer(tokenizer, promptprompt, image_fileyour_image.jpg, output_pathyour/output/dir, base_size1024, image_size768, crop_modeTrue, save_resultsTrue)把image_file换成你自己的文档图片路径即可识别结果会保存到output_path。四、vLLM 路线图片流式识别 PDF批量转换追求速度就用 vLLM 推理所有参数集中在 config.py 中修改配置项作用INPUT_PATH/OUTPUT_PATH输入图片/PDF 与输出目录CROP_MODE是否启用动态分辨率切图MAX_CONCURRENCYPDF 并发数显存不足可调小cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm # 单张图片流式输出边识别边打印 python run_dpsk_ocr2_image.py # PDF高并发批量转换速度与上一代持平 python run_dpsk_ocr2_pdf.py # 基准测试批量评测OmniDocBench v1.5 python run_dpsk_ocr2_eval_batch.py对应源码分别是 run_dpsk_ocr2_image.py、run_dpsk_ocr2_pdf.py 和 run_dpsk_ocr2_eval_batch.py。五、识别结果长什么样以图片脚本为例输出目录会生成三类文件result.mmd清洗后的最终 Markdown图片占位符已被替换为![](images/0.jpg)result_ori.mmd模型原始输出含坐标标注信息result_with_boxes.jpg在原图上画出标题、文本块等定位框方便人工校对文档中的插图还会被自动裁剪到images/子目录配合 image_process.py 的动态分辨率逻辑大幅面扫描件的细节也不易丢失。六、常用Prompt速查表场景Prompt完整文档转 Markdown带布局image\n|grounding|Convert the document to markdown.纯文本提取无布局image\nFree OCR.小技巧识别结果出现长串重复时可检查 ngram_norepeat.py 中的去重处理器配置——它默认禁止 20 元组重复白名单保留表格 tokentd、/td让长表格识别更稳定。七、写在最后从克隆仓库到第一份 Markdown 产出整个过程不到 10 分钟。如果你想深入原理可以阅读项目自带的论文 DeepSeek_OCR2_paper.pdf。对于需要把扫描件、截图、PDF 批量转为 Markdown 的团队和个人来说DeepSeek-OCR-2 目前是最省心的开源选择之一 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

PaddleNLP TIPC 指南:Windows 端基础训练与预测功能测试全流程解析
PaddleNLP TIPC 指南:Windows 端基础训练与预测功能测试全流程解析

人工智能大模型预训练微调LoRARLHF强化学习分布式训练 【免费下载链接】PaddleNLP Easy-to-use and powerful LLM and SLM library with awesome model zoo. 项目地址: https://gitcode.com/gh_mirrors/pa/PaddleNLP 点击查看 免费下载 导读 本文围绕 PaddleNLP 仓… · 2026/9/27 7:56:07

状态机与 BPMN 怎么选?把同一个客户开通流程画两遍
状态机与 BPMN 怎么选?把同一个客户开通流程画两遍

状态机与 BPMN 怎么选?把同一个客户开通流程画两遍 《企业级 Workflow 实战:从审批流到 AI Agent》|第 04 篇 / 共 24 篇 本篇成果:同一案例的状态迁移表、可运行 Python 状态机、BPMN 2.0 XML 模型与结构校验。 阅读边界&#xf… · 2026/9/27 7:56:07

电影网站开发背景实战案例:3个技巧让流量翻倍
电影网站开发背景实战案例:3个技巧让流量翻倍

电影网站开发背景实战案例:3个技巧让流量翻倍 别再被那些花里胡哨却丑得掉渣的模板网站坑了!我见过太多甲方拿着几百块的模板站来问为什么没流量,答案很简单:搜索引擎根本不想给这种“垃圾堆”排名。今天咱们不聊虚的,直接上 实战案例… · 2026/9/27 7:56:07

Ajenti 面板运行与调试指南:服务管理、命令行参数与日志排障
Ajenti 面板运行与调试指南:服务管理、命令行参数与日志排障

后端运维 【免费下载链接】ajenti Ajenti Core and stock plugins 项目地址: https://gitcode.com/gh_mirrors/aj/ajenti 点击查看 免费下载 本篇指南围绕 Ajenti 官方手册的 "Running Ajenti" 章节展开,完整覆盖面板服务的启动/停止/重启方式… · 2026/9/27 8:40:41

多规格体检心电图与超声报告 OCR 结构化 Prompt:从波形描述中提取关键结论
多规格体检心电图与超声报告 OCR 结构化 Prompt:从波形描述中提取关键结论

多规格体检心电图与超声报告 OCR 结构化 Prompt:从波形描述中提取关键结论在整理父母全身体检档案时,**心电图(ECG)与超声影像报告(B超/彩超,如颈动脉超声、心脏彩超、腹部B超)**属于结构极其复… · 2026/9/27 8:40:41

如何刷网站访问量完整流程
如何刷网站访问量完整流程

避坑指南:揭秘网站流量刷量背后的最佳实践 找建站公司最怕什么?怕被坑高价,更怕交钱后网站像摆设,没流量、没询盘。很多老板花大几万做了个站,结果后台数据惨淡,一问才知对方所谓的“优化”只是买了点垃圾流量,或者干脆就是静态页面扔在服务器上吃灰。… · 2026/9/27 8:40:35

Plotly 动态交互式桑基图流量漏斗过滤:基于多级滑块的端到端路径剪枝
Plotly 动态交互式桑基图流量漏斗过滤:基于多级滑块的端到端路径剪枝

Plotly 动态交互式桑基图流量漏斗过滤:基于多级滑块的端到端路径剪枝在复杂的全链路用户行为路径与多渠道流量转化分析中,全站行为日志通常包含了数百个细分入口、数十个中间承接页、以及上千条长尾微小流向路径: 如果直接将所有的流量路径一… · 2026/9/27 8:40:10

wordpress换空间搬家哪家好评多老手避坑指南
wordpress换空间搬家哪家好评多老手避坑指南

wordpress换空间搬家哪家好评多老手避坑指南 自己不会代码想做网站,却卡在服务器迁移这步动弹不得?别慌,wordpress换空间搬家这件事,看似简单实则暗坑无数,选对服务商真的能省掉你80%的头发。很多新手在搜索“wordpress换… · 2026/9/27 8:40:10

企业级 GitOps 封网期变更管控:基于 PR 审批流与 OPA 策略引擎的硬拦截
企业级 GitOps 封网期变更管控:基于 PR 审批流与 OPA 策略引擎的硬拦截

企业级 GitOps 封网期变更管控:基于 PR 审批流与 OPA 策略引擎的硬拦截在采用 GitOps 模式作为唯一交付途径的企业环境中,Git 仓库就是生产环境的真理之源(Single Source of Truth)。在平时,开发者通过提交 PR 合入主干… · 2026/9/27 8:40:10

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码