从单一文本到图像、语音、视频的融合理解多模态大模型正在开启人工智能的“通感”时代。在上一篇文章中我讨论了AI从规模竞赛转向智能效率的趋势。今天我们把镜头对准一个更激动人心的方向——多模态。如果说纯文本模型让AI学会了“阅读”那么多模态模型则让AI同时拥有了“眼睛”和“耳朵”。2025年的一个显著变化是顶尖多模态模型GPT-4V、Gemini Pro 1.5、Claude 3 Vision已经能够像人类一样在一张图表、一份手绘草稿、甚至一段屏幕录像中提取信息并做出有逻辑的回应。但理论归理论我们不妨直接写一段代码亲手让一个开源多模态模型完成“看图问答”。代码实战用开源模型实现图像理解我们选用 Salesforce 开发的BLIP-2模型可以在普通GPU甚至CPU上运行。它会接收一张图片和一个文本问题然后生成答案。环境准备bashpip install transformers pillow torch完整代码图像问答pythonfrom transformers import Blip2Processor, Blip2ForConditionalGeneration from PIL import Image import torch # 1. 加载模型和处理器首次运行会下载约3GB processor Blip2Processor.from_pretrained(Salesforce/blip2-opt-2.7b) model Blip2ForConditionalGeneration.from_pretrained( Salesforce/blip2-opt-2.7b, torch_dtypetorch.float16 if torch.cuda.is_available() else torch.float32, device_mapauto ) # 2. 准备图像这里使用一张网络图片示例你也可以换成自己的照片 image_url https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/sample_image.jpg # 也可以从本地加载: image Image.open(your_photo.jpg) import requests from io import BytesIO response requests.get(image_url) image Image.open(BytesIO(response.content)).convert(RGB) # 3. 提问多模态的核心图像文本联合理解 question What is this animal doing? # 4. 将图像和问题一起编码 inputs processor(image, question, return_tensorspt).to(model.device) # 5. 生成答案 out model.generate(**inputs, max_new_tokens50) answer processor.decode(out[0], skip_special_tokensTrue) print(f问: {question}) print(f答: {answer})运行后会输出类似text问: What is this animal doing? 答: The dog is lying on the grass.进阶支持中文的多模态模型如果你需要中文问答可以换用Qwen-VL-Chat或CogVLM。下面给出一个使用CogVLM中文/英文均支持的示例python# 需要先安装: pip install transformers accelerate bitsandbytes from transformers import AutoModelForCausalLM, LlamaTokenizer model_name THUDM/cogvlm-chat-hf tokenizer LlamaTokenizer.from_pretrained(lmsys/vicuna-7b-v1.5) model AutoModelForCausalLM.from_pretrained( model_name, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, trust_remote_codeTrue, device_mapauto ) image Image.open(your_image.jpg) question 图片里有什么物体它们的位置关系怎样 # CogVLM的对话格式 inputs model.build_conversation_input_ids(tokenizer, queryquestion, history[], images[image]) inputs {k: v.to(model.device) for k, v in inputs.items()} output model.generate(**inputs, max_new_tokens200) answer tokenizer.decode(output[0], skip_special_tokensTrue) print(answer)这段代码揭示了什么跨模态对齐模型内部将图像分割成视觉token与文本token映射到同一个语义空间然后统一推理。这是多模态智能的基石。小样本泛化BLIP-2没有见过这张具体的狗照片却能准确回答“狗在做什么”——说明它学到了“躺”、“草地”等抽象概念与视觉特征的关联。硬件友好BLIP-2的2.7B版本在普通游戏显卡8GB显存上就能运行推理速度约2-3秒/图。这印证了我之前说的“成本革命”——多模态能力已经不再是实验室的奢侈品。多模态的应用爆发点有了上面的技术基础我们可以想象几个即将成熟的场景图表分析自动化金融分析师上传一张复杂的K线图AI直接给出技术面解读和趋势预测。教育辅导学生拍一道几何题AI不仅能识别文字还能理解图形中的辅助线、角度标注并给出分步解题思路。盲人辅助实时描述周围环境——“你前方2米有一个台阶右侧是自动门开关”。仍未解决的挑战多模态模型目前最头疼的问题依然是空间关系推理和计数。例如问“图中有几个红色的圆形”——模型可能把相邻的两个圆形数成一个。这也是为什么我在第一篇文章中强调“推理能力突围”的重要性。好消息是结合思维链Chain-of-Thought的多模态推理模型已经出现如Google的PaLI-X未来一年内这些问题有望大幅改善。写在最后多模态不是给文本模型“加一双眼睛”那么简单。它要求模型理解物理世界的结构、材质、光影、透视——这些是纯文本永远无法触达的维度。当你运行上面那段代码看着AI准确描述出一张陌生照片时你会直观地感受到机器正在从一个“符号处理器”进化为一个“现实世界的观察者”。下一个五年真正的智能一定诞生在多种感官的交汇处。