DeepSeek推出视觉能力
过去几个月,DeepSeek 在 AI 赛道上走得很快。从发布让整个行业重新审视定价策略的推理模型,到持续迭代对话体验,这家中国 AI 公司一直在用”性价比”三个字撬动市场。现在,它又把目光投向了多模态领域——DeepSeek 的聊天界面正式加入了视觉理解能力。
不只是看懂文字
DeepSeek 这次更新的核心很简单:它能”看”图了。你上传一张照片、一张截图或者一张表格图片,它可以准确描述画面内容、提取文字信息、分析图表数据。无论是问它”这张幻灯片讲了什么”,还是”帮我看看这个朋友圈截图里的关键信息”,它都能给出有意义的解读。
需要明确的是,这是图像理解,不是图像生成。你不能让 DeepSeek 帮你”画一只猫”或者”把这张图的背景改成海滩”。它的能力集中在读懂你给它的视觉信息,然后用语言回馈给你。这看起来是克制的一步,但恰恰是许多用户高频需要的——看懂截图、理解文档、分析图表,这些场景比”画画”要实用得多。
比同行便宜一个量级
价格是 DeepSeek 最直接的武器,这次也不例外。Hacker News 上有用户对比后发现,用 DeepSeek 做同样的图像分析任务,成本只有 Claude 和 ChatGPT 的几分之一。“这比支持语音输入要重要得多,“一位评论者直言。
这个定价逻辑其实很聪明。多模态 API 调用量大、频次高,如果能把单次分析成本压下来,用户的采用意愿会指数级上升。一个开发者可以放心地用它批量处理截图、分析产品图片、甚至做 OCR 流水线,而不用担心账单爆炸。
有意思的对比是 Gemini。Gemini 在图像分析上一直有很好的口碑,Google 在这方面的积累很深。但 DeepSeek 证明了一件事:即使不拥有顶尖的多模态基础模型,只要把工程优化做到位、把定价策略打穿,就能在这个细分战场里站稳脚跟。
AI 竞争的新维度
DeepSeek 长期保持着一个”怪异”的产品组合:有世界级的语言模型,有足以搅动市场的定价,但至今没有推出自己的语音合成和语音识别功能。这次增加视觉能力,而没有去做 TTS/STT,某种程度上透露了它的优先级——先把”输入”这件事做到极致,再考虑”输出”的多元性。
从更大的视角看,AI 的价格战正在进入第二阶段。第一阶段的重点是文本 token 的价格,各家已经把百万 token 的成本打到几乎可以忽略不计。第二阶段的战场是模态的扩展——图片、音频、视频的理解成本,谁能在这些赛道上把价格做到合理,谁就能拿到下一波企业客户。
DeepSeek 的视觉能力上线,标志着这家公司不再只是”那个很便宜的语言模型”。它正在变成一个多模态入口,尽管每一步都走得很克制。对于普通用户来说,这意味着以后找人帮忙”看一下这张图写了什么”时,AI 可以替你省下这笔时间。
来源:Hacker News
