男儿本色

DeepSeek又发新模型,小而美玩出新高度_我的网站

银河护卫队2

一 |     就在刚刚,DeepSeek开源了一个3B模型DeepSeek-OCR。虽然体量不大,但模型思路创新的力度着实不小。    刚刚过去的9月,新一届大学生凭借一纸录取通知书,开启了4年的大学时光。                   众所周知,当前所有LLM处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。然而,几乎与此同时,这些刚刚被郑重签收的录取通知书,已悄然出现在二手交易平台上。                             中国海洋大学今年的录取通知书附赠的“南极海水吊坠”,被卖出高价。(图/二手平台截图)                    中国海洋大学今年的录取通知书附赠“南极海水吊坠”,被网友称为“全网最浪漫录取通知书”。但很快就有人发现,它在二手平台上被炒到1800~5000元。

二 | 南京大学带有纪念邮票的纪念礼盒,也标价数百至上千元。序列越长,算力烧得越狠。                             于是,DeepSeek团队想到了一个好办法。卖家大多是刚收到录取通知书的2025级新生,有人整套售卖,也有人单独出售录取通知或其中的某个纪念品。                   录取通知书不再是学生珍藏的纪念品,而是可以变现的隐形财富。既然一张图能包含大量文字信息,而且用的Token还少,那不如直接把文本转成图像?这就是所谓的“光学压缩”——用视觉模态来给文本信息“瘦身”。这一轮出售风波,也隐隐透露了一代年轻人对待学历的心态正在悄然发生变化。

三 |                    与其白白落灰,不如卖掉折现                    近几年,各大高校在录取通知书的设计上愈发讲究,越来越有仪式感。

四 |                    而OCR正好天然适合验证这个思路,因为它本身就是在做“视觉→文本”的转换,而且效果还能量化评估。复旦大学的2025年新生录取通知书,以潞绸包装封面,附赠云南茶砖和采用沉金工艺的NFC卡片;哈尔滨工业大学则以宇宙和卫星为主题设计礼盒,礼盒主体采用特种航天材料制作。                   但矛盾的是,随着全社会电子化程度提高,一些高校并不需要新生凭录取通知书报到,只需在相应程序上完成手续即可。

五 | 越来越卷的录取通知书,更像是迎合新生及家长的心理需求而做出的一系列仪式化的改进。                             论文显示,DeepSeek-OCR的压缩率能达到10倍,OCR准确率还能保持在97%以上。                   啥意思呢?就是说,原本需要1000个文本Token才能表达的内容,现在只用100个视觉Token就搞定了。即使压缩率拉到20倍,准确率也还有60%左右,整体效果相当能打。                   已经有不少“南极海水吊坠”被卖掉。                   OmniDocBench基准测试结果显示:                    只用100个视觉Token,就超过了GOT-OCR2.0(每页256个Token)的表现;          用不到800个视觉Token,干翻了MinerU2.0(平均每页超过6000个Token)。(图/二手平台截图)                    “蓝色水晶材质,金色边框典雅大方。                        在实际生产中,一块A100-40G显卡就能每天生成超过20万页的LLM/VLM训练数据。成色完好。吊坠配有精美礼盒包装,内含南极海水纪念卡片。送礼自用都很合适。”闲鱼App上,一条中国海洋大学录取通知书所附赠的南极海水吊坠前不久刚刚被人拍下,链接显示为“已售”状态,售价为1299元。                   以往被悉心珍藏的录取通知书和纪念品,到了现在,却变成年轻人在二手平台上“回血出物”的商品。这当中所折射的社会观念变迁,值得玩味,似乎不能一味地加以批判。

六 |                    在教育资源和物质条件相对匮乏的二十世纪八九十年代,大学生是“稀缺物种”,考取大学意味着在教育水平上拥有绝对优势,甚至在某种程度上意味着“逆天改命”,代表了阶层跃升的可能性。20个节点(160块A100)直接飙到每天3300万页。

七 | 如今,高等教育日益普及,以2025年为例,本科生录取人数约为480万人。                   大学生不再稀缺,大学录取通知书虽然仍具有纪念性,但其含金量很难再和过去同日而语,象征意义也随之淡化。                             DeepSeek-OCR由两个核心组件组成:                    DeepEncoder(编码器):负责图像特征提取和压缩;          DeepSeek3B-MoE(解码器):负责从压缩后的视觉Token中重建文本。                   对于习惯了无纸化电子世界的Z世代来说,实体纪念物所附带的情感浓度已经没有那么强烈了。手持录取通知书拍照片,上传至社交媒体,收获一批点赞和祝福之后,一纸录取通知书似乎就完成了其使命。                        让我们来重点说说DeepEncoder这个引擎。                   因此,在一些更为看重实用性的人眼里,与其把这些设计精美的纪念礼盒和录取通知书束之高阁,白白落灰,不如把它折现,变成大学的“启动资金”或必需品——一副蓝牙耳机、一个机械键盘、一次旅行,等等。                   它的架构很巧妙,通过把SAM-base(8000万参数)和CLIP-large(3亿参数)串联起来,前者负责“窗口注意力”提取视觉特征,后者负责“全局注意力”理解整体信息。或者就当成一次“断舍离”,把它换成一个月的生活费。

八 |                    中间还加了个16×卷积压缩器,在进入全局注意力层之前把Token数量大幅砍掉。                   和名校沾边,就能卖得出去?                    带有名校光环的事物,似乎总是能得到国人的偏好和青睐。无论是985高校在校庆时推出的文创礼盒以及校徽,还是印有高校名称字样的T恤和帆布袋等,或多或少都存在着一定溢价。                   举例而言,一张1024×1024的图像,会被切成4096个patch token。但经过压缩器处理后,进入全局注意力层的Token数量会大幅减少。                   就连一些旁人眼中极其抽象的事物,只要和名校紧密绑定,就会被赋予商品价值。

九 |                    这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。                   在二手平台上,除了录取通知书,一些更“匪夷所思”的商品时有出现。                   而且DeepEncoder还支持多分辨率输入,从512×512的Tiny模式(64个Token)到1280×1280的Large模式(400个Token),一个模型全搞定。

十 | 500毫升的北京大学未名湖湖水,被标价20元到100元不等;900克的北大校内土壤则被卖到129元。

十一 | 商家还表示,这些拍品均附带拍摄视频,以证明它们确属“北大出品”。“(北大校内土)对多种植物生长具有神奇效果,有助于调节空气湿度。                   目前开源版本支持的模式包括原生分辨率的Tiny、Small、Base、Large四档,还有动态分辨率的Gundam模式,灵活性拉满。                             解码器用的是DeepSeek-3B-MoE架构。                   别看只有3B参数,但采用了MoE(混合专家)设计——64个专家中激活6个,再加2个共享专家,实际激活参数约5.7亿。

十二 | 这也让模型既有30亿参数模型的表达能力,又保持了5亿参数模型的推理效率。                   解码器的任务就是从压缩后的视觉Token中重建出原始文本,这个过程可以通过OCR风格的训练被紧凑型语言模型有效学习。

十三 | 每日凝视未名湖湖水,可提振精神,激发智慧。

十四 | ”                    在二手平台上,北大未名湖湖水和校内土被当成商品出售。(图/二手平台截图)                    考入北大、在未名湖边徜徉或许需要极大的努力、天赋和运气,但购买一瓶未名湖湖水却唾手可得。

十五 | 购买这些带着名校符号的商品,反映的是人们对顶尖学府的想象、向往和遗憾,以及根深蒂固的名校情结。                   数据方面,DeepSeek团队也是下了血本。                   从互联网收集了3000万页多语言PDF数据,涵盖约100种语言,其中中英文占2500万页。                   作为95后的颜青坦言,自己正是这类消费行为的亲历者。颜青回忆道,高中时期自己被老师灌输了不少关于名校有多牛的鸡汤,班主任更会时不时分享“晚上不睡觉疯狂学习,最终考上清华北大”的励志故事。                   高二时,趁高考全校放假三天,颜青特地从河北坐了几小时动车来到北京。                   数据分两类:粗标注直接用fitz从PDF提取,主要训练少数语言的识别能力;精标注用PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。她去“梦中情校”北大逛了几圈,还买了不少带有北大logo的文创产品。                   对于少数语言,团队还搞了个“模型飞轮”机制——先用有跨语言泛化能力的版面分析模型做检测,再用fitz生成的数据训练GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了60万条样本。                   此外还有300万条Word文档数据,主要提升公式识别和HTML表格解析能力。其中,有一本封面上印着北大徽标的记事本,颜青每天都用它来写当天的to-do list,还会摘抄一些激励自己的鸡汤句子。                   虽然颜青已经不记得自己当时花了多少钱,但相对于物价较低的老家,她所买的这些印着北大logo的各色产品,算是一笔相当大的开支。                   场景OCR方面,从LAION和Wukong数据集收集图像,用PaddleOCR标注,中英文各1000万条样本。                   这似乎形成了一种奇妙的对照:一方面,有相当多的人仍然在追逐名校符号;另一方面,新世代的大学生对录取通知书所承载的名校光环逐渐祛魅。而这一纸录取通知的奇幻漂流,未来将去往何方,暂时还无人预知。                   在国外,有不少一流大学的做法是这样的:不再给新生邮寄录取通知书,而是由新生自行在所申请大学的页面下载offer。

十六 |                              DeepSeek-OCR不仅能识别文字,还具备“深度解析”能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取:                    图表:金融研究报告中的图表可以直接提取为结构化数据;          化学结构式:识别并转换为SMILES格式;          几何图形:对平面几何图形进行复制和结构化解析;          自然图像:生成密集描述(dense captions)。                        这在STEM领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。这份offer相当于一份入校指南,告知学生被什么专业录取、何时去学校报到、如何办理入学手续等。有论者认为,这种做法可以减少印制、发送录取通知书的成本,且高效,值得借鉴。

十七 |                    当然,也有不少人愿意保留录取通知书,因为它定格了自己人生中的重要节点。                   第一作者Haoran Wei此前曾供职于阶跃星辰,期间发布并开源了GOT-OCR2.0系统                    值得注意的是,DeepSeek团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。

十八 |                    人类的记忆会随时间衰退,越久远的事情记得越模糊。

十九 | DeepSeek团队想,那能不能让AI也这样?于是,他们的方案是:                    1. 把超过第k轮的历史对话内容渲染成图像;          2. 初步压缩,实现约10倍的Token减少;          3. 对于更久远的上下文,继续缩小图像尺寸;          4. 随着图像越来越小,内容也越来越模糊,最终达到“文本遗忘”的效果。                   这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。

| 以颜青为例,后来她没有如愿考上北大,而是去了另一所985高校。当被问及会不会考虑出售自己的录取通知书时,颜青几乎瞬间就给出了否定的答案:“虽然我最后考上的学校比不上北大,但这张录取通知书至少证明了我考上过这个学校。                   虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑“无限上下文”。                             简言之,DeepSeek-OCR表面上是个OCR模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为LLM文本信息处理的高效压缩媒介?                    初步答案是肯定的,7—20倍的Token压缩能力已经展现出来了。”                    本文来自微信公众号:惊蛰青年,作者:梅珍里,编辑:桃子酱,校对:遇见。

|                    当然,团队也承认这只是个开始。单纯的OCR还不足以完全验证“上下文光学压缩”,后续还计划开展数字–光学文本交替预训练、“大海捞针”式测试,以及其他系统性评估。                   不过不管怎么说,这在VLM和LLM的进化路上,又多了一条新赛道。                   去年这个时候,大家还在卷怎么让模型“记得更多”。今年DeepSeek直接反其道行之,不如让模型学会“忘掉一些”。                   确然,AI的进化,有时候不是做加法,而是做减法。小而美,也能玩出大花样,DeepSeek-OCR这个3B小模型就是最好的证明。                   GitHub主页:http://github.com/deepseek-ai/DeepSeek-OCR          论文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf          模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR                    本文来自微信公众号:APPSO (ID:appsolution)。

Current article:http://z91.zhanggengsenchaiweikeng.cfd/60hbmn3/nfi.html

Published on:13:57:47


相关新闻

知乎

06:49:30

大都会

03:43:41

热门推荐

  • 德罗赞助掘金冲击西部前六 预测概率升至86%
  • 科威特外交大臣杰拉赫将访华
  • 【成长园—体验】蛇来运转 巳巳如意—沈北新区道义二小幼教集团年俗系列活动(四)
  • “三季报”的启示:关注消费的实质是关注收入
  • US Shooting: अमेरिका के स्कूल में गोलीबारी, 3 की मौत से हड़कंप; मौके पर पहुंची FBI
  • 大国外交最前线丨共叙友谊、携手发展 中约元首会谈释放新信号
  • 75家机构齐聚、国际化率48%!2026年服贸会金融专题打造金融开放新高地
  • 《古墓丽影:决定版: Legacy of Atlantis》正在“重塑”系列初代作品,加入专注槽、技能树与草药酿造系统。
  • 沙特AI基金:若美国要求愿从中国撤资
  • 中原再担保集团股份有限公司董事长薛怀宇接受审查调查
  • 男儿本色版权所有 本站点信息未经允许不得复制或镜像 法律顾问:伐木累
  • 咱们结婚吧 copyright ? 2000 - 2019
  • 疑犯追踪第二季 幸福账单 我们结婚了 银魂 真人版