从GOT-OCR到百度文心魏浩然的“非典型”技术突围与穿透周期的底层心法副标题“真正的强者不是天赋最耀眼的人而是那个在每一次技术转向中都能重新扎下根去的人”标签#人生成长 #魏浩然 #百度文心 #DeepSeek #OCR #多模态大模型技术的浪潮从不等待任何人但它永远奖赏那些在浪潮之下默默打磨底层能力的人。今天要聊的这个人在DeepSeek V4技术报告的离职名单中他可能是最低调、最沉默的那一位——他叫魏浩然。没有公开演讲没有商业PR没有高调的跳槽官宣。在喧嚣的AI名利场中他像一个“隐形人”留下的只有几篇惊艳行业的OCR论文和一个没有被任何镜头捕捉到的沉默背影。但在2026年9月这个沉默的背影终于有了新的坐标原DeepSeek核心研究员魏浩然已带队转入百度基础模型研发部BMU出任文心大模型多模态算法负责人。这条路径背后是一个1996年出生的青年研究者用不到五年时间从阶跃星辰到DeepSeek再到百度三次跳上技术前沿的跃迁故事。剥开他的履历藏着普通人穿越技术周期最具参照意义的底层逻辑。一、起点不是名校但选择足够“硬核”中科院直博的底层修炼1996年魏浩然出生于山东济南济阳县一个在AI人才地图上几乎不会被标注的地方。但他在学业上走出了一条极其清晰的路线2023年直博毕业于中国科学院大学研究方向为大语言模型与多模态大模型。“直博”意味着他在本科阶段就展现出了足够的科研潜力被导师直接纳入博士培养轨道。而中科院大学的博士训练给予他的不是“名校光环”而是一套硬核的科研方法论如何定义问题、如何设计实验、如何在失败中迭代假设。深度成长思考一真正决定你天花板的不是你从哪里出发而是你用什么样的底层能力出发。魏浩然没有清北本科的标签也没有海外顶尖名校的镀金。但他用中科院直博的五年完成了对大模型和多模态最底层原理的系统性掌握。这种“底层能力”才是他后来能在OCR这个看似传统的领域做出范式级创新的真正根基。二、阶跃星辰用两个“第一”定义自己的技术坐标博士毕业后魏浩然加入阶跃星辰StepFun在VLM组参与Step系列多模态大模型的研发主要负责模型架构设计、预训练以及Step-encoder的设计与训练。在阶跃星辰期间他做出了两个后来被行业反复提及的工作Vary双塔多模态模型。他主导开发了Vary模型这一架构后来被DeepSeek-VL模型借鉴。一个在创业公司做出的架构设计能被行业头部玩家的基础模型所采纳——这本身就说明了它的技术分量。GOT-OCR2.0。这是让他真正“破圈”的工作。GOT-OCR2.0成为第一个登上Huggingface Trending #1的OCR模型也是端到端OCR模型的经典之作“是OCR技术在大语言模型时代重回公众视野的开端”。深度成长思考二在一个“冷门”领域做到极致比在热门领域做一个平庸的追随者价值高一个数量级。当大模型圈都在卷千亿参数、卷对话能力的时候魏浩然选择了OCR——一个被很多人认为“太传统”的方向。但GOT-OCR2.0的成功证明了一个反直觉的规律在一个高门槛的垂直领域把自己做成绝对壁垒远比在拥挤的主战场上做一个可替代的参与者更有战略价值。三、DeepSeek岁月用“光学压缩”重新定义OCR的边界2024年魏浩然加入DeepSeek LLM组作为大语言模型研究员进行数据scaling研究并参与了DeepSeek V3.2和V4的开发。但真正让他成为行业T1级别人物的是他主导的DeepSeek-OCR系列模型。DeepSeek-OCR2025年10月上下文光学压缩这篇论文的核心思想极其原创用光学2D映射的方式将长上下文进行高倍压缩。魏浩然作为第一作者提出了通过自主研发的DeepEncoder将传统方法中成千上万个文本Token压缩为数量大幅减少的紧凑视觉Token。在压缩率低于10倍的条件下OCR解码准确率仍可保持在约97%。这一工作的意义远不止于“OCR识别更准了”。它从根本上探索了一条解决大模型长上下文输入时显存暴涨与计算开销过大问题的全新路径——用视觉表征来极限压缩长文本信息。DeepSeek-OCR一经开源便登顶Huggingface TrendingGitHub Stars一月超过20K到2026年初在Huggingface上总下载量达数千万。DeepSeek-OCR 22026年1月视觉因果流如果说第一代是“压缩”的革命第二代则是对“理解”的颠覆。在DeepSeek-OCR 2Visual Causal Flow中魏浩然再次作为第一作者提出了一个极具洞察力的问题传统视觉语言模型总是按死板的光栅扫描顺序左上到右下处理图像Token但这完全违背了人类的视觉感知方式。人类阅读复杂文档时遵循的是灵活、语义驱动的因果扫描模式。为此他设计了DeepEncoder V2首次用轻量级语言模型Qwen2-0.5B取代传统的CLIP ViT作为视觉编码器赋予编码器因果推理能力使其能够根据图像语义动态重排视觉Token的顺序——这是一个从“机械扫描”到“智能理解”的范式跃迁。论文三位作者为魏浩然、孙耀峰和李宇琨魏浩然位列第一作者。深度成长思考三真正的创新往往发生在你“重新定义问题”的那一刻而不是“优化已有答案”的时刻。魏浩然的突破不在于把OCR的准确率从95%提到97%而在于他重新定义了OCR在大模型时代的角色它不再只是一个“把图片变成文字”的工具而是一种用视觉表征压缩长文本信息、降低大模型计算开销的全新范式。这种“重新定义问题”的能力来自于他在中科院时期打下的底层科研训练以及在阶跃星辰期间积累的多模态架构设计经验。四、离职与沉默春节前后的转身数月后的答案2026年4月DeepSeek V4技术报告正式公开。在这份长达58页、近300人署名的报告中10人标注“已离职”魏浩然赫然在列。他的离职时间被明确描述为“今年春节前后”。与同期离职的王炳宣腾讯、罗福莉小米、郭达雅字节Seed、阮翀元戎启行不同魏浩然的去向在当时没有任何公开披露。这种沉默持续了数月。直到2026年9月3日多家媒体同时确认魏浩然已于2026年初加入百度并带领团队转入百度基础模型研发部BMU出任文心大模型多模态算法负责人。而他在百度的工作早已悄然开花结果。Unlimited OCR2026年6月22日开源魏浩然加入百度后带领团队在端到端文档感知领域取得重大突破开源的Unlimited OCR模型在业内权威的文档理解评测基准OmniDocBench测试中取得全球第一刷新了端到端OCR性能的SOTA纪录登上GitHub和Hugging Face多个趋势榜单。深度成长思考四沉默不是缺席而是用结果说话。真正的强者不需要在聚光灯下宣告下一步只需要在沉默中完成下一步。魏浩然从春节前后离开DeepSeek到6月开源Unlimited OCR模型中间只有三四个月的时间。他没有花时间在媒体上解释“我为什么离开”“我去了哪里”而是直接把一个全球SOTA的模型放在所有人面前。在AI这个以月为单位迭代的行业里沉默本身就是一种战略。五、百度BMU青年技术骨干接管研发中枢魏浩然的加入发生在百度大模型组织持续重构的关键节点。2025年11月百度新设基础模型研发部BMU和应用模型研发部AMU将底座模型与应用模型研发拆分。2026年7月1日出生于1997年、曾主导国内首个开源对话模型复旦MOSS的青年学者孙天祥正式加入百度出任BMU负责人并进入百度模型委员会BMC。魏浩然此次带队进入BMU被业内视为“孙天祥全面接手基础模型部门后文心作为研发阵地重新集结的关键拼图”。从孙天祥统管通用基座到魏浩然挂帅多模态算法百度的模型研发中枢正加速向青年技术骨干倾斜。六、写在最后穿透周期的三层成长启示回顾魏浩然从济南到北京、从阶跃星辰到DeepSeek再到百度的完整轨迹这条路径给了普通人最具操作性的三点启示1. 底层能力比名校标签更持久扎根他没有清北光环没有海外名校PhD。但他用中科院直博的五年建立了对大模型和多模态最底层原理的系统性理解。这种底层能力让他在每一次技术转向中都能快速重新扎根而不是被浪潮甩下。2. 在垂直领域做深比在热门领域做广更有壁垒深耕OCR在大模型时代看似“不性感”但魏浩然用GOT-OCR2.0和DeepSeek-OCR系列证明在一个高门槛领域做到T1级别其稀缺性和不可替代性远超在热门方向上做一个“还不错”的参与者。3. 用结果代替解释用沉默代替喧嚣定力从DeepSeek离职后的数月沉默到百度Unlimited OCR的全球SOTA魏浩然展示了一种稀缺的职业品格不急于向外界证明什么只急于把下一件事做成。在AI这个充满噪音的行业里“做完”永远比“说了什么”更有说服力。4. 在不确定性中保持自己的节奏闭环从GOT-OCR2.0到DeepSeek-OCR v1到v2再到百度Unlimited OCR魏浩然的每一步都形成了完整的闭环——从一个想法到一篇论文从一个开源模型到一个SOTA结果。这种“闭环能力”才是穿越技术周期最可靠的护城河。
企业数字化 ERP 产品动态
相关推荐
TorchNPU LLM性能基准实战:如何快速测试热门大模型在昇腾NPU上的真实表现 TorchNPU LLM性能基准实战:如何快速测试热门大模型在昇腾NPU上的真实表现 【免费下载链接】pytorch 作为 Ascend for PyTorch 社区的核心组件,TorchNPU 是昇腾专为 PyTorch 打造的深度学习适配插件,使 PyTorch 框架能够直接调用昇腾 NPU&… · 2026/9/24 15:46:58
palera1n 越狱指南:A8 到 A11 设备三步拿回可写文件系统 palera1n 越狱指南:A8 到 A11 设备三步拿回可写文件系统 【免费下载链接】palera1n Jailbreak for A8 through A11, T2 devices, on iOS/iPadOS/tvOS 15.0, bridgeOS 5.0 and higher. 项目地址: https://gitcode.com/GitHub_Trending/pa/palera1n
palera1n 越… · 2026/9/24 15:46:58
Unity HDRP 渲染管线 Camera 输出到RenderTexture没有Alpha通道 项目属性渲染管线:HDRPUnity版本:2022.3.62f3项目背景将Camera指定输出,TargetTexture及将背景颜色改为(0,0,0,0)将UI指定RenderTexture,但没有透明通道修改方式修改项目… · 2026/9/24 15:46:58
前期工作小结 从暑假开始到目前,主要做的工作是:阅读学姐的增量学习的论文,以及对论文内的数据进行复现。论文阅读:读完学姐的论文,主要理解 LAUR 增量学习框架——用贝叶斯参数建模缓解灾难性遗忘,BERT/BGE 做特征编码&… · 2026/9/24 17:04:05
video-use 技能实战指南:用对话式 Agent 完成视频剪辑、调色、字幕与动画合成 AI 技能/插件音视频视频处理人工智能 【免费下载链接】video-use Edit videos with coding agents 项目地址: https://gitcode.com/GitHub_Trending/vid/video-use 点击查看 免费下载 导读
video-use 是一个开源、基于对话驱动的视频编辑技能(Skill&am… · 2026/9/24 17:03:59
基于SpringBoot+Vue的美妆产品推荐系统(源代码+文档+PPT+调试+讲解) 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台… · 2026/9/24 17:03:47
openFrameworks 视频播放实战:基于 ofVideoPlayer 的加载、速度控制与像素可视化 openFrameworks 视频播放实战:基于 ofVideoPlayer 的加载、速度控制与像素可视化 【免费下载链接】openFrameworks openFrameworks is a community-developed cross platform toolkit for creative coding in C. 项目地址: https://gitcode.com/gh_mirrors/op/ope… · 2026/9/24 17:03:47
30 分钟配好 Continue:JetBrains 插件安装、离线构建与调参指南 30 分钟配好 Continue:JetBrains 插件安装、离线构建与调参指南 【免费下载链接】continue open-source coding agent 项目地址: https://gitcode.com/GitHub_Trending/co/continue
写代码时总要切到网页版 AI 问一句,答完再切回来贴代码… · 2026/9/24 17:03:47
【Dify】FLUX绘画机器人多模态识别与语音交互自动化 以多模态智能交互为核心的自动化创作方式,正推动AI艺术、教育与硬件结合的快速发展。视觉识别、语音播报与机器人控制的结合,为传统绘画和教学带来了新的可能。
本文梳理FLUX绘画机器人结合多模态识别和语音播报的完整工作流,实现从图片输入、内容识别、创意生成到语音解读… · 2026/9/24 17:03:27
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44