DeepSeek-OCR-2环境搭建教程如何三步用Conda CUDA 11.8 vLLM 0.8.5跑通GPU文档OCR【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2DeepSeek-OCR-2 是 DeepSeek 团队推出的新一代视觉文档 OCR光学字符识别模型基于 Visual Causal Flow视觉因果流思路能把扫描版文档、PDF 页面一键转换为 Markdown 或纯文本。本教程带你用Conda CUDA 11.8 vLLM 0.8.5三步搭好 GPU 环境并快速跑通第一次文档 OCR。DeepSeek-OCR-2 是什么为什么值得折腾环境相比第一代方案只靠 CLIP 这类非因果视觉编码器DeepSeek-OCR-2 的DeepEncoder V2直接用 Qwen2500M语言模型当视觉编码器并引入可学习 query 建立新阅读顺序让模型像人一样按因果顺序读文档版面更乱也稳。官方技术细节见 DeepSeek_OCR2_paper.pdf。上手收益图片 OCR流式输出识别结果run_dpsk_ocr2_image.pyPDF OCR高并发批处理速度与第一代 DeepSeek-OCR 持平run_dpsk_ocr2_pdf.py基准评测支持 OmniDocBench 批量评测脚本一键安装前的软硬件清单动手前先对照这张清单避免装到一半才发现缺东西项目版本 / 要求GPUNVIDIA 显卡驱动兼容CUDA 11.8Python3.12.9Conda 环境PyTorch2.6.0cu118 版本vLLM0.8.5cu118 whl 包flash-attn2.7.3其他依赖见 requirements.txttransformers 4.46.3、PyMuPDF 等 显存建议推理脚本默认gpu_memory_utilization在 0.75 ~ 0.9 之间显存偏紧的卡可以适当调低并发数。环境搭建教程三步跑通 GPU OCR第一步获取项目代码git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 cd DeepSeek-OCR-2第二步创建并激活 Conda 虚拟环境conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2固定 Python 3.12.9 很重要——它是官方验证过的组合能最大程度减少兼容性问题。第三步安装 PyTorch、vLLM 0.8.5 与依赖包# 1) CUDA 11.8 版 PyTorch pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 # 2) vLLM 0.8.5 的 cu118 whl 包从 vLLM 官方 Releases 下载 v0.8.5 对应 whl 后安装 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl # 3) 项目依赖 pip install -r requirements.txt # 4) FlashAttention pip install flash-attn2.7.3 --no-build-isolation⚠️ 如果看到类似vllm 0.8.5cu118 requires transformers4.51.1的版本冲突报错不用管官方已确认该环境下 vLLM 与 transformers 代码可共存。最快验证方法跑通第一次文档 OCR环境装好后进入 vLLM 推理目录cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm打开 config.py把INPUT_PATH/OUTPUT_PATH改成你自己的路径然后按场景选择脚本图片流式输出python run_dpsk_ocr2_image.pyPDF并发批处理python run_dpsk_ocr2_pdf.py基准批量评测python run_dpsk_ocr2_eval_batch.py如果你更习惯 HuggingFace Transformers 方式也可以直接运行 run_dpsk_ocr2.py。模型加载与自定义核心实现在 deepseek_ocr2.py图片预处理逻辑在 image_process.py。两种常用 Prompt 怎么选Prompt效果image\n\|grounding\|Convert the document to markdown.文档转 Markdown带版式还原image\nFree OCR.自由 OCR只提取文字内容常见问题 FAQQ1安装 vLLM 时提示 transformers 版本冲突忽略即可官方环境即如此transformers 4.46.3 vLLM 0.8.5 混用无碍。Q2PDF 批量处理时显存不足OOM调低 config.py 中的MAX_CONCURRENCY默认 100它直接决定并发请求数同时可下调各脚本里的gpu_memory_utilization。Q3识别结果有重复短语项目内置了NoRepeatNGramLogitsProcessor见 ngram_norepeat.py做去重采样保持SKIP_REPEAT True即可。Q4动态分辨率是什么模型默认按 (0~6)×768×768 1×1024×1024 的切片方式编码图像对应 (0~6)×144 256 个视觉 tokenBASE_SIZE/IMAGE_SIZE/CROP_MODE等参数同样在 config.py 中可调。到这里Conda CUDA 11.8 vLLM 0.8.5 的 DeepSeek-OCR-2 GPU 环境就算彻底跑通了——接下来把你的 PDF 丢进INPUT_PATH享受文档进、Markdown 出的流畅体验吧 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
wordpress单页链接设置避坑指南:3步搞定不踩雷 wordpress单页链接设置避坑指南:3步搞定不踩雷 域名服务器搞不懂?别慌,这是很多老板建站初期的噩梦。你明明买了最贵的服务器,结果网站打不开,或者链接乱跳转,钱花了没效果,这才是最气的地方。今天这篇wordpress单页链接设置避坑指… · 2026/9/27 7:15:47
5步搞定html5网站检测,从零搭建避开90%的坑 5步搞定html5网站检测,从零搭建避开90%的坑 网站做好了没人访问,这不仅仅是流量玄学,很多时候是底子没打牢。很多新手朋友问,明明页面挺好看,为什么百度搜不到,甚至打开速度还慢?问题往往出在代码结构和标准兼容性上。今天不聊虚的,直接拿一… · 2026/9/27 7:57:33
FastAPI + PostgreSQL 实战:做一个重启后还能继续的审批流程 FastAPI PostgreSQL 实战:做一个重启后还能继续的审批流程 《企业级 Workflow 实战:从审批流到 AI Agent》|第 03 篇 / 共 24 篇 本篇成果:提交客户服务申请、创建运营待办、完成审批、查询流程历史,并实测应用进程重… · 2026/9/27 7:57:33
LeetCode 1096.花括号展开 II:一个一百行的解题方法(DFS) 【LetMeFly】1096.花括号展开 II:一个一百行的解题方法(DFS)
力扣题目链接:https://leetcode.cn/problems/brace-expansion-ii/
如果你熟悉 Shell 编程,那么一定了解过花括号展开,它可以用来生成任意字符… · 2026/9/27 7:57:27
Amethyst 瓦片地图实战:从 Tile 特征实现到 TileMap 组件创建完整指南 【免费下载链接】amethyst Data-oriented and data-driven game engine written in Rust 项目地址: https://gitcode.com/gh_mirrors/ame/amethyst 点击查看 免费下载 本篇技术指南围绕 Amethyst 游戏引擎(Rust 编写的数据驱动游戏引擎)的 a… · 2026/9/27 7:57:21
AutoBangumi 解析器配置指南:RSS 标题解析引擎、语言与全局过滤规则 后端前端音视频 【免费下载链接】Auto_Bangumi AutoBangumi - 全自动追番工具 项目地址: https://gitcode.com/gh_mirrors/au/Auto_Bangumi 点击查看 免费下载 AutoBangumi 的解析器(Parser)负责从 RSS 条目标题中抽取结构化的番剧元数据&am… · 2026/9/27 7:57:21
换机照片怎么迁移才靠谱?6种方案对比,原图与备份一次讲清 换手机时,照片迁移最需要关注的不是单纯的“速度”,而是文件有没有完整过去、原始信息有没有变化,以及迁移完成后有没有备用副本。如果只有几百张照片,手机直连通常就能解决;但面对几千甚至上万张照片,尤其… · 2026/9/27 7:57:21
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01