花叔专栏 / 内容创作

看到DeepSeek- OCR模型后,Andrej Karpathy提出了一个很激进的想法:所有LLM的输入都应该是图像,包括纯文本。

看到DeepSeek- OCR模型后,Andrej Karpathy提出了一个很激进的想法:所有LLM的输入都应该是图像,包括纯文本。

什么意思?

传统的大语言模型:文本 → tokenizer → LLM → 输出
很无聊

Andrej的vision:文本 → 渲染成图片 → LLM → 输出
即使你要输入的就是纯文本,也先把它渲染成图片,再喂给模型。

这就好玩了,这么做有什么好处?

他给了4个理由:

1. 信息压缩更高效

这正是DeepSeek-OCR证明的。一页文档,传统方式可能需要2000个text tokens,用vision tokens只要64个。压缩率30倍。

文本tokens很浪费,图像tokens更密集。

2. 更通用

Text tokens只能表达文字。但现实世界的信息不只是文字:
- 粗体、斜体
- 彩色文字
- 表格、图表
- 任意图像

全部渲染成图像输入,模型天然就能处理这些。

3. 可以用双向注意力

这是技术细节。传统的text-to-text是自回归的(从左到右)。图像输入可以用双向注意力,看到全局信息,更强大。

4. 删除tokenizer(重点!)

Andrej很讨厌tokenizer。

他的吐槽:
- Tokenizer是一个丑陋的、独立的、非端到端的阶段
- 它继承了Unicode、字节编码的所有历史包袱
- 有安全风险(如continuation bytes攻击)
- 两个看起来一样的字符,在tokenizer眼里可能完全不同
- 这个emoji在tokenizer里只是一个奇怪的token,不是一张真正的笑脸图片

他希望tokenizer消失。

他的vision是什么

- 输入:全部是图像(即使原本是文本)
- 输出:还是文本(因为输出像素不现实)

OCR只是vision→text任务之一。很多text→text任务都可以变成vision→text。

这篇读完了,下次实践再见。

花叔的插画头像

AI Native Coder · 独立开发者 · 作者

《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。

本文收录自微信公众号。在原平台阅读 ↗

返回花叔专栏