番外06 - 小硅也能看图说话
番外06|小硅也能"看图说话"
从正文到番外走到这儿,小硅一直靠"一张嘴"打天下——所有本事都围绕文字展开。可你日常用AI时早就不只打字了:拍张照让它识别、截个图让它分析、甚至丢段语音让它翻译。这一篇,聊聊小硅是怎么"长出眼睛和耳朵
"的。
👀 人天生就是"多模态"的
你想想自己:眼睛看图、耳朵听声、嘴巴说话,大脑把这些完全不同的信号搅在一起理解——你看到一只猫、听到它"喵"一声、嘴里说"好可爱",这三件事对你的大脑来说是同一个瞬间、同一个意思。你从没觉得"看"和"听"是两件事,因为大脑天生就会把它们融合。
这就叫"多模态"——同时处理多种感官信息。
以前的小硅只有一张嘴:你喂它文字,它吐文字。像一只被蒙住眼睛、堵住耳朵的鹦鹉,全靠听你念字来理解世界。现在的多模态大模型,是让小硅也长出了眼睛和耳朵——你可以给它看一张图、放一段录音,它也能"读懂"。不再是瞎子摸象,而是真的能看到那头大象了。
🧩 图片怎么喂给一只鹦鹉?
问题来了:小硅的流水线是为文字设计的——一个token接一个token往前走。图片又不是文字,怎么塞进去?
答案出乎意料地朴素:把图片切成碎片,假装它是一种"外语"。
具体操作叫 ViT(Vision Transformer):把一张图切成很多小方块——比如 16×16 像素一块——就像把一幅画切成拼图碎片。一张普通照片能切出几百块。每个碎片经过一番数学变换,变成一个"词块"(token)。然后这些图片token跟文字token排成一队,送上同一条流水线,让Transformer一视同仁地处理。
想象一下:你拿到一幅梵高的星空,不是整张去"看",而是先裁成 200 块小卡片,每张卡片写上一句描述——"深蓝色漩涡""金黄色星星"——然后把 200 句描述排成一段话来"读"。听起来笨,但对机器来说反而好使:它擅长处理序列,不擅长一眼扫全图。
对小硅来说,一张猫的照片不过是一句"用像素语写的长句子"。它读图的方式和读文字一模一样——从头扫到尾,标记哪些碎片之间关系紧密(注意力机制又登场了)。猫耳朵那几块碎片跟猫眼睛那几块碎片"注意力"很强,模型就明白它们属于同一张脸。
🌉 中间还有个"同声传译"
但有个麻烦:图片碎片变出来的向量,和文字token的向量,根本不在同一个坐标系。就好比你把一段中文和一段阿拉伯文摆一块儿——字面上挨着,脑子里根本对不上。
所以中间需要一个"翻译器",学术上叫投射层(Projection)。它干的活儿就是:把图片向量"翻译"到文字向量的空间里,让两种模态住进同一栋楼、说同一套坐标。
打个比方:联合国开会,中文代表和英文代表各说各话,但中间坐着同声传译——翻译完,大家说的就对齐到同一个"意思空间"了。投射层就是这个同声传译。翻译好了,小硅就能混着读"图+文",像读一篇夹了外语引用的文章一样自然。
🎞️ 视频和音频?同一个套路
搞定了图片,视频和音频就是顺手的事。
视频是什么?一串连续的图片帧。 一秒钟 24 帧,每帧照样切碎片、变token。一段 10 秒的视频就变成了一条超长的token序列——长到可能有上万个token。模型处理视频时,本质上就是在"读"一篇超长的、用像素语写的连续叙事。
音频呢?声波被切成一小段一小段的时间切片——每片大约几十毫秒——每片同样变token。你说一句"今天天气不错",声音被切成几十个小片段,每片变成一个token,排好队等着被处理。
所以最终画面是这样的:文字是token,图片是token,视频是token,音频也是token——**万物皆token
**。统统排成一列,喂给同一个Transformer。模型不在乎你给的是文字还是画面还是声音,它眼里只有"一串需要预测下一个的序列"。这个设计的优雅之处在于:不管未来出现什么新模态(触觉?脑电波?),只要能变成token,就能接进来。
⚡ 你天天在用,但没意识到的事
GPT-4V能看图回答问题、Gemini能处理长视频、Claude能读PDF截图——背后都是这套"切碎→变token→对齐→统一处理"的路子。你拍一道数学题给AI,它先把照片切碎变token,再混着你的提问文字一起"读",最后吐出解题步骤。整个过程跟你丢给它一段纯文字题目,在模型内部的处理流程几乎一模一样。
不过有个区分要提一嘴:"理解图片"和"生成图片"走的不完全是同一条路。 你让AI看图说话,靠的是Transformer读token;你让AI画图(Midjourney、DALL-E、Sora),靠的主要是扩散模型(Diffusion)——从一团噪点里一步步"去噪"出画面。打个比方:看图说话像是读一本书然后写读后感,画图像是拿一团橡皮泥慢慢捏出一个雕塑——两种完全不同的手艺。两种能力正在融合,但目前底层机制仍然不同。
🧊 一个让你心疼钱包的冷知识
还记得吗,AI是按token收费的。
一段文字可能就几十个token,但一张图被切碎后可能变成几百个token。一段视频?轻松上万。你以为只是"随手发了张图让它看看",其实后台处理了相当于一篇小论文的token量。
这就是为什么多模态模型普遍更贵——不是厂商黑心,是你那张照片真的让小硅多"读"了好几百个词。
🎁 这一篇带走的
所有模态——文字、图片、视频、音频——最终都被切成token,送进同一个Transformer。多模态不是给AI换了个脑子,而是给它装了更多"感官入口",入口不同,流水线相同。
下次你拍张照片丢给AI,心里就清楚了:它在把你的照片切成几百块拼图碎片,翻译成自己能懂的"词",然后像读一篇文章一样从头扫到尾。
番外六篇到这儿就完了。从"越喂越聪明"的Scaling Law,到"多想一会儿"的推理模型,到"又强又便宜"的MoE,到"脑子动手术"的微调,到"手不止一双"的CodeAct,再到今天"也能看图说话"的多模态——你对AI的理解,已经不只是"会用",而是真的"看懂了它是怎么回事"。
这就是我和小硅想给你的。