深度求索开源新模型 DeepSeek-OCR 2，提出“Visual Causal Flow”

聖光之護

发布时间：2026-01-27 19:52:23

743人浏览过

来源于php中文网

原创

深度求索（deepseek）最新推出开源 ocr 模型：deepseek-ocr 2，并首次集成全新视觉编码器——deepencoder v2。该编码器摒弃了传统模型固化的“左上→右下”光栅式图像扫描范式，转而借鉴人类视觉认知机制，构建出更具语义感知能力的「因果流（causal flow）」处理逻辑。

深度求索开源新模型 DeepSeek-OCR 2，提出“Visual Causal Flow”

项目主页：https://www.php.cn/link/20ea88ff2d4986dc61c779051ca98a10 模型权重：https://www.php.cn/link/84532fb3fd1d8145737e673af93315e8 技术论文：https://www.php.cn/link/20ea88ff2d4986dc61c779051ca98a10/blob/main/DeepSeek\_OCR2\_paper.pdf

据官方介绍，DeepEncoder V2 能够依据图像内容语义动态调整视觉 Token 的排列顺序，而非拘泥于物理空间位置的线性遍历。这一设计更贴近人类在观察复杂场景时“依逻辑线索跳跃式聚焦”的真实视觉行为。

传统多模态大模型（VLMs）普遍采用固定方向的光栅扫描策略解析图像，这种机械式的处理方式与人类灵活、内容驱动的视觉注意机制存在本质差异；尤其在面对表格结构、数学公式、双栏排版等非线性布局时，易导致上下文错位与语义误读。

而 DeepSeek-OCR 2 正是依托 DeepEncoder V2，赋予模型一种新型的「视觉因果流（Visual Causal Flow）」能力——即根据图像内在结构与任务需求，智能重组织视觉 Token 序列。

深度求索开源新模型 DeepSeek-OCR 2，提出“Visual Causal Flow”

该架构创新性地引入定制化注意力掩码（Attention Mask）机制：

AIBox 一站式AI创作平台

AIBox365一站式AI创作平台，支持ChatGPT、GPT4、Claue3、Gemini、Midjourney等国内外大模型

下载

视觉 Token 分支：维持双向注意力，保障模型具备类 CLIP 的全局感受野，充分建模图像整体语义；

因果流 Token 分支：启用因果注意力（类似纯 Decoder 架构的 LLM），确保每个 Token 仅能关注其前置序列，从而支撑有序推理与动态重排序。

由此，视觉 Token 保留跨区域信息聚合能力，因果流 Token 则专注构建符合阅读逻辑的结构化表示。模型采用多尺度裁剪策略（Multi-crop strategy），适配不同分辨率输入，最终送入语言模型的重排序视觉 Token 数量介于 256 至 1120 之间。

DeepSeek 团队指出，这一设计为构建统一全模态编码器提供了关键思路：未来有望通过可学习的模态特定查询（modality-specific learnable queries），在同一套参数体系下高效完成图像、音频与文本的联合表征与压缩。DeepSeek-OCR 2 所提出的“双级联一维因果推理器”架构，将二维理解解耦为“阅读逻辑推理”与“视觉任务推理”两个协同子过程，或将成为通向真正二维语义推理的重要技术路径。

延伸阅读

DeepSeek 发布全新开源 OCR 模型 DeepSeek-OCR
受 DeepSeek-OCR 启发的新范式：所有输入 LLM 的信息，本质上都应以图像形式呈现

苹果发布 Xcode 26.1.1，改进并修复多项 AI 功能

Git 2.52-rc0 发布，推进 SHA-1 与 SHA-256 的互操作支持

用数据照亮成长之路：PandaCoder Git 统计工具窗口

Git 3.0 有望在 2026 年发布，默认启用更安全的 SHA-256 哈希算法

JetBrains 宣布 DataGrip 面向非商业用途免费

AI工具

AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型，支持联网搜索。

下载

相关标签:

git github 编码 ai pdf 大模型排列 deepseek 架构 Token github ocr https

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：腾讯混元 AI Infra 团队开源 HPC-Ops，高性能 LLM 推理核心算子库下一篇：苹果 M3 Mac 现已成功启动 Asahi Linux，但暂不具备实际可用性

作者最新文章

Go 中为何不能直接转换切片类型？深入解析类型转换规则与安全替代方案

2026-03-12 09:23

Vue 中实现多选限制：仅允许勾选 3 项，其余自动禁用（支持反选）

2026-03-12 09:25

OpenGL 3.x 渲染 20K 精灵体（Sprites）性能优化实战指南

2026-03-12 09:26

上海停车app如何进行预约

2026-03-12 09:27

vscode源控件里怎么好多数字

2026-03-12 09:43

Java 中正确解码 Unicode 私用区（PUA）字符的完整指南

2026-03-12 09:46

《生化危机9》MOD让疯狂难度更难被丧尸咬了会感染

2026-03-12 09:47

如何让图片的20%移出网页可视区域实现“半隐式”视觉效果

2026-03-12 10:09

如何在 Go 的 flag 包中为必需的位置参数提供清晰的 Usage 提示

2026-03-12 10:10

如何让图片的20%移出视口实现“半隐式”边缘展示效果

2026-03-12 10:24

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

登录token无效

登录token无效解决方法：1、检查token的有效期限，如果token已经过期，需要重新获取一个新的token；2、检查token的签名，如果签名不正确，需要重新获取一个新的token；3、检查密钥的正确性，如果密钥不正确，需要重新获取一个新的token；4、使用HTTPS协议传输token，建议使用HTTPS协议进行传输；5、使用双因素认证，双因素认证可以提高账户的安全性。

6631

2023.09.14

登录token无效怎么办

登录token无效的解决办法有检查Token是否过期、检查Token是否正确、检查Token是否被篡改、检查Token是否与用户匹配、清除缓存或Cookie、检查网络连接和服务器状态、重新登录或请求新的Token、联系技术支持或开发人员等。本专题为大家提供token相关的文章、下载、课程内容，供大家免费下载体验。

843

2023.09.14

token怎么获取

获取token值的方法：1、小程序调用“wx.login()”获取临时登录凭证code，并回传到开发者服务器；2、开发者服务器以code换取，用户唯一标识openid和会话密钥“session_key”。想了解更详细的内容，可以阅读本专题下面的文章。

1092

2023.12.21

token什么意思

token是一种用于表示用户权限、记录交易信息、支付虚拟货币的数字货币。可以用来在特定的网络上进行交易，用来购买或出售特定的虚拟货币，也可以用来支付特定的服务费用。想了解更多token什么意思的相关内容可以访问本专题下面的文章。

2200

2024.03.01

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4295

2026.01.21

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2917

2024.08.16

Python异步编程与Asyncio高并发应用实践

本专题围绕 Python 异步编程模型展开，深入讲解 Asyncio 框架的核心原理与应用实践。内容包括事件循环机制、协程任务调度、异步 IO 处理以及并发任务管理策略。通过构建高并发网络请求与异步数据处理案例，帮助开发者掌握 Python 在高并发场景中的高效开发方法，并提升系统资源利用率与整体运行性能。

2026.03.12

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

136

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

热门下载

网站特效

网站源码

网站素材

前端模板