· 9 分钟阅读
国内大模型日常使用对比:编程、多模态与长文本实测
最近国内大模型更新了一轮,Kimi 2.6、GLM 5.1、Qwen 3.6、DeepSeek V4,还有字节的豆包,各家都在喊自己最强。
我不想看跑分,不想看排行榜,我就想搞清楚一件事,日常用起来,到底谁好使。
这段时间我实际跑了一遍,用的场景也很简单,小程序开发排错、法律文书撰写、合同审查,就是普通打工人每天干的事。下面是我自己的判断,不一定对,但全是真刀真枪的体感。
先说一个让我最意外的发现。
选大模型,第一个判断标准不是谁更聪明,而是它能不能直接看图。
这听起来像是个小功能,但实际用起来差别巨大。写代码排错的时候,最自然的动作是什么?截图,丢给 AI,让它看看哪里出了问题。你不会去复制报错日志、整理格式、一段一段贴过去,那太反人类了。
Kimi 2.6 原生支持图片理解,截图丢过去秒解析,OCR 加视觉推理一条龙。GLM 5.1 不支持图片输入,所有报错必须手动复制文字,整理格式,操作繁琐到你想骂人。
有人说,专业程序员都是复制文本排错的,比发图更精准。这话没错,但大部分人就是不愿意那么干。包括专业程序员。截图一键上传和复制粘贴格式化文本,效率体感完全不在一个维度。
国内目前支持图片理解的主力模型有三个,Kimi 2.6、Qwen 3.6 Max、GLM-5V。但三个的视觉能力差距很大。Kimi 的代码截图识别最准,长截图、密集报错、中英文混合基本零失误。Qwen 3.6 够用但偶尔漏行。GLM-5V 代码截图识别最差,经常漏行、符号识别错误,反而拖后腿。
所以你看,Cursor 选了 Kimi 做底层模型,不是随便选的。程序员最高频的排错方式就是截图,Kimi 在这件事上就是最合适的。
多模态不是锦上添花,是日常使用体验的分水岭。
再说编程能力。
日常小程序开发、云函数、前端代码,Kimi 2.6 和 GLM 5.1 之间我几乎感觉不到差距。语法精准、逻辑清晰、调试能力都够用。
但 GLM 有一个场景确实更强,纯文本的深度逻辑推理。
我之前有个法律纠纷,写应诉文书、答辩状、证据梳理,全程用 GLM 5.1 和 Claude Sonnet 4.6 互相 PK。我发现它们两个已经非常接近了,各有所长。Claude 更擅长抠原文细节、引用案卷原文,GLM 更擅长重构论证逻辑、设计攻防话术、优化文书结构。
说实话这个结果让我挺意外的。GLM 在纯文本法律对抗场景,已经摸到了国际一线的门槛。
而 Kimi 在这个场景上反而弱一些。它更擅长「看材料、读合同、理解案情」,做深度法律攻防推演不如 GLM。
所以如果只看代码能力,两者日常差距不大。但往深了走,GLM 的逻辑推理上限更高,Kimi 的多模态体验更顺手。各有各的活法。
再聊一个很有意思的事。
Kimi 的官网客户端支持百万级上下文,上传整份合同、整本代码工程,直接喂进去完整解析,体验无敌。但如果你用 Kimi 的 API,不管是官方的还是第三方云平台的,上限全部锁定在 200K tokens。
200K 和百万级,差了五倍。长合同会被截断,条款会丢失,法律场景绝对不能用。
为什么?因为百万级长上下文是 Kimi 最核心的产品壁垒,它要把这个能力留给自己 C 端的用户,不通过 API 放出去给竞品。算力成本也是一个原因,百万上下文推理成本极高,开放 API 会被大量滥用。
DeepSeek 的策略完全相反。V4 的 API 默认全档位开放,128K、256K、512K、1M 随你选。微信云开发、阿里云、腾讯云,全部给到百万级。因为 DeepSeek 的定位就是做全球性价比最高的 B 端基座,长上下文是它的核心卖点,必须全开放。
同样是百万级上下文能力,一个藏着只给自己用,一个敞开了给所有人。这不是技术差异,是商业策略的底层选择。
对普通用户来说,你自己日常用 Kimi 网页端,百万上下文加顶级 OCR,体验拉满。但如果你做产品后端需要调用 API,DeepSeek V4 是唯一正确的选择。
最后说说其他几个。
Qwen 3.6 Max,通义千问的最新旗舰。特点就两个字,中庸。视觉、代码、文案、逻辑全在线,但没有任何一项做到行业顶尖。长文不如 Kimi,逻辑不如 GLM,性价比不如 DeepSeek。好处是中文语境最接地气,解释通俗易懂,适合普通用户日常聊天和简单文案。
字节的豆包,多模态底子极强,视频理解能力国内独一档。但通用逻辑推理弱,长文本拉胯,专业生产力场景基本排不上。它的战略重心在短视频和直播生态,通用大模型只是配角。所以你一直觉得它不温不火,因为在你关注的专业生产力赛道,它确实不在核心竞争圈。
Minimax,两个硬伤,不支持图片理解,逻辑推理明显差一档。我写法律文书的时候试过,逻辑漏洞百出,完全没法用。
说到这,国内大模型的格局其实已经很清晰了。
第一梯队,Kimi 和 DeepSeek,双雄。Kimi 是现在的体验天花板,多模态加长文本,日常用着最舒服。DeepSeek 是未来的性价比之王,V4 文本能力已经追上来了,一旦视觉版落地,格局可能一夜翻转。
第二梯队,GLM。强逻辑推理,法律文书、数学、科研这些场景它是天花板。但放弃了多模态内卷,日常使用天然吃亏。
第三梯队,Qwen。全能中庸,稳定兜底,适合普通用户,专业场景无优势。
至于字节和 Minimax,在你关注的专业生产力赛道,基本可以排除。
我自己现在的分工是这样的。日常开发排错、合同审查、截图丢给模型,全程 Kimi 2.6。法律文书、应诉攻防,走 GLM 5.1。产品后端 API 调用,走 DeepSeek V4。Qwen 偶尔兜底。
不是谁最好,是谁在什么场景下最合适。大模型的时代,选型不是单选题,是排兵布阵。