· 9 分钟阅读

国内大模型日常使用对比:编程、多模态与长文本实测

最近国内大模型更新了一轮,Kimi 2.6、GLM 5.1、Qwen 3.6、DeepSeek V4,还有字节的豆包,各家都在喊自己最强。

我不想看跑分,不想看排行榜,我就想搞清楚一件事,日常用起来,到底谁好使。

这段时间我实际跑了一遍,用的场景也很简单,小程序开发排错、法律文书撰写、合同审查,就是普通打工人每天干的事。下面是我自己的判断,不一定对,但全是真刀真枪的体感。


先说一个让我最意外的发现。

选大模型,第一个判断标准不是谁更聪明,而是它能不能直接看图。

这听起来像是个小功能,但实际用起来差别巨大。写代码排错的时候,最自然的动作是什么?截图,丢给 AI,让它看看哪里出了问题。你不会去复制报错日志、整理格式、一段一段贴过去,那太反人类了。

Kimi 2.6 原生支持图片理解,截图丢过去秒解析,OCR 加视觉推理一条龙。GLM 5.1 不支持图片输入,所有报错必须手动复制文字,整理格式,操作繁琐到你想骂人。

有人说,专业程序员都是复制文本排错的,比发图更精准。这话没错,但大部分人就是不愿意那么干。包括专业程序员。截图一键上传和复制粘贴格式化文本,效率体感完全不在一个维度。

国内目前支持图片理解的主力模型有三个,Kimi 2.6、Qwen 3.6 Max、GLM-5V。但三个的视觉能力差距很大。Kimi 的代码截图识别最准,长截图、密集报错、中英文混合基本零失误。Qwen 3.6 够用但偶尔漏行。GLM-5V 代码截图识别最差,经常漏行、符号识别错误,反而拖后腿。

所以你看,Cursor 选了 Kimi 做底层模型,不是随便选的。程序员最高频的排错方式就是截图,Kimi 在这件事上就是最合适的。

多模态不是锦上添花,是日常使用体验的分水岭。


再说编程能力。

日常小程序开发、云函数、前端代码,Kimi 2.6 和 GLM 5.1 之间我几乎感觉不到差距。语法精准、逻辑清晰、调试能力都够用。

但 GLM 有一个场景确实更强,纯文本的深度逻辑推理。

我之前有个法律纠纷,写应诉文书、答辩状、证据梳理,全程用 GLM 5.1 和 Claude Sonnet 4.6 互相 PK。我发现它们两个已经非常接近了,各有所长。Claude 更擅长抠原文细节、引用案卷原文,GLM 更擅长重构论证逻辑、设计攻防话术、优化文书结构。

说实话这个结果让我挺意外的。GLM 在纯文本法律对抗场景,已经摸到了国际一线的门槛。

而 Kimi 在这个场景上反而弱一些。它更擅长「看材料、读合同、理解案情」,做深度法律攻防推演不如 GLM。

所以如果只看代码能力,两者日常差距不大。但往深了走,GLM 的逻辑推理上限更高,Kimi 的多模态体验更顺手。各有各的活法。


再聊一个很有意思的事。

Kimi 的官网客户端支持百万级上下文,上传整份合同、整本代码工程,直接喂进去完整解析,体验无敌。但如果你用 Kimi 的 API,不管是官方的还是第三方云平台的,上限全部锁定在 200K tokens。

200K 和百万级,差了五倍。长合同会被截断,条款会丢失,法律场景绝对不能用。

为什么?因为百万级长上下文是 Kimi 最核心的产品壁垒,它要把这个能力留给自己 C 端的用户,不通过 API 放出去给竞品。算力成本也是一个原因,百万上下文推理成本极高,开放 API 会被大量滥用。

DeepSeek 的策略完全相反。V4 的 API 默认全档位开放,128K、256K、512K、1M 随你选。微信云开发、阿里云、腾讯云,全部给到百万级。因为 DeepSeek 的定位就是做全球性价比最高的 B 端基座,长上下文是它的核心卖点,必须全开放。

同样是百万级上下文能力,一个藏着只给自己用,一个敞开了给所有人。这不是技术差异,是商业策略的底层选择。

对普通用户来说,你自己日常用 Kimi 网页端,百万上下文加顶级 OCR,体验拉满。但如果你做产品后端需要调用 API,DeepSeek V4 是唯一正确的选择。


最后说说其他几个。

Qwen 3.6 Max,通义千问的最新旗舰。特点就两个字,中庸。视觉、代码、文案、逻辑全在线,但没有任何一项做到行业顶尖。长文不如 Kimi,逻辑不如 GLM,性价比不如 DeepSeek。好处是中文语境最接地气,解释通俗易懂,适合普通用户日常聊天和简单文案。

字节的豆包,多模态底子极强,视频理解能力国内独一档。但通用逻辑推理弱,长文本拉胯,专业生产力场景基本排不上。它的战略重心在短视频和直播生态,通用大模型只是配角。所以你一直觉得它不温不火,因为在你关注的专业生产力赛道,它确实不在核心竞争圈。

Minimax,两个硬伤,不支持图片理解,逻辑推理明显差一档。我写法律文书的时候试过,逻辑漏洞百出,完全没法用。


说到这,国内大模型的格局其实已经很清晰了。

第一梯队,Kimi 和 DeepSeek,双雄。Kimi 是现在的体验天花板,多模态加长文本,日常用着最舒服。DeepSeek 是未来的性价比之王,V4 文本能力已经追上来了,一旦视觉版落地,格局可能一夜翻转。

第二梯队,GLM。强逻辑推理,法律文书、数学、科研这些场景它是天花板。但放弃了多模态内卷,日常使用天然吃亏。

第三梯队,Qwen。全能中庸,稳定兜底,适合普通用户,专业场景无优势。

至于字节和 Minimax,在你关注的专业生产力赛道,基本可以排除。

我自己现在的分工是这样的。日常开发排错、合同审查、截图丢给模型,全程 Kimi 2.6。法律文书、应诉攻防,走 GLM 5.1。产品后端 API 调用,走 DeepSeek V4。Qwen 偶尔兜底。

不是谁最好,是谁在什么场景下最合适。大模型的时代,选型不是单选题,是排兵布阵。

    分享:
    返回文章列表
    实战洞察10 分钟阅读

    AI 产品商业模式:订阅制、B 端与代理人模式

    豆包开始收费了。 标准版 68/月,加强版 200/月,专业版 500/月。 500 块一个月。在中国市场,一个 AI 对话产品敢定这个价,相当大胆。对比 Claude Pro 的 20 美元/月,豆包专业版几乎是它的 3.5 倍。 但最值得玩味的不是价格本身,而是定这个价的那个公司。 豆包的母公司是字节跳动。抖音、今...

    阅读全文
    实战洞察7 分钟阅读

    AI 应用开始被定价:Manus、Cursor 的商业逻辑

    Manus这事,最有意思的不是监管。 也不是Meta。 而是它终于给AI应用层打了一个价格标签。 20亿美元。 一个通用办公Agent,被Meta拿20亿美元报价收购,后来交易被叫停,老股东又准备按差不多的价格买回来,再考虑去香港上市。 这条线当然很戏剧。 中国团队做出来,迁到新加坡,被Meta收购,被监管叫停,老股东...

    阅读全文
    实战洞察8 分钟阅读

    豆包收佣金:AI 对话入口的电商模式

    8月10日,豆包开始对电商商品收佣金了。 酒店订单综合费率12%,生活服务类最高18%,比抖音主站普遍高出4到10个点。 这是国内第一个AI对话入口,对商家交易明码标价收钱。 第一反应,12%是不是太贵了。 别急着下结论,先横向比一下。 携程的综合获客成本,算上佣金、竞价广告、促销扣点,酒店行业实测能到28%到38%。...

    阅读全文
    实战洞察4 分钟阅读

    DeepSeek Harness 开源:插件化架构与 AI 编程生态

    DeepSeek又干了一件事。 8月13号晚上,DeepSeek开源了一个叫Harness的产品,代号dsh。 不到两天,GitHub星标突破10万。 要知道,DeepSeek自家的V3大模型上线一年半,攒了大概10.4万星。 Harness两天就快追平了。 先说下Harness是个啥。 现在大家用AI写代码,Clau...

    阅读全文