AI模型使用体验对比
Claude
我愿称之为“掌管AI的神”。
至少在此时,Claude的表现明显超出其他国外模型御三家,更不用说对国内模型那更是绝对碾压。
封神之战
前几天“昙花一现”的 Fable 5 模型,虽然只是短暂使用,但我觉得它无愧于其“神话”之名。
我的另一篇文章Nodejs 导致 extract-zip 异常,记载了一个比较诡异的问题。
当时遇到这个问题后,我尝试把这个问题分别向 GPT, Claude(4.8 Opus) 提问,都没有得到有效的解决方案。它们给出的一些方案,要么根本无效,要么已经过时,要么实际上已经在我项目中配置过了无需再改了。
无奈之下我选择手动调试。我在node_modules中寻找源码,一路通过console.log打日志来定位问题,打了十几个日志后终于锁定了一个较小的范围。
在这个时候我又向GPT-5.5提问,你猜怎么着,GPT它花了一大半的篇幅用来指责我现在写的这些临时代码有多么不规范、可能存在哪些隐患,纠结于这些表象,可是对于我最关心的这个bug却无动于衷,随便扯了几句没什么营养的话。不仅没解决问题,反而还让我怀疑人生,难道我真错了?
我继续用相同的问题向Claude Fable 5提问。非常 amazing 啊!它第一轮行动,先扫描了我现有的改动,大致上认可了我的尝试是有效的,并实际运行了一次,确认了问题确实与我提问中所描述的一致。
此时Fable 5就已经有了一个明确的怀疑对象,它写了一个临时的.js脚本,直接调用那个依赖库的某个函数,执行后进一步缩小了范围。如此再循环一次,第三轮执行后,它已经完全锁定了bug的原因。最后它联网搜索,甚至还给我贴了两个 issue 链接,表示这个问题确实存在并且已经在社区中有了反馈。
这次排查bug的经过,完全可以说Fable 5已经非常拟人。如果说之前的 gpt, opus 可以替代初级或者中级研发工程师,此时的Fable 5已经算的上是个成熟的资深工程师,它的牛逼之处不在于它已经掌握了多少知识,而是它已经掌握了一套系统而有效的解决问题方法论。
之后我还让它尝试解决一些棘手的问题,表现都出乎意料的好。我对它非常有信心,打算在周六花一天时间,狠狠鞭策它给我干活,给我写出成吨的代码。
可是我失算了,周六一早就得到噩耗:用不了了。
昙花一现
详细时间线与停服原因如下:
正式发布: 2026年6月9日,Anthropic正式发布了高阶模型 Claude Fable 5。
暂停访问: 2026年6月13日,Anthropic宣布全面暂停Fable 5及Mythos 5的所有访问权限。
暂停原因: 美国政府以国家安全和出口管制为由,发布指令限制“外国国民”访问这两款高阶模型(包括身处美国境内的外国籍人士)。为确保合规,Anthropic采取了对所有客户一刀切暂停的措施。有消息指出,这可能与政府担忧该模型存在被“越狱”(Jailbreak)的风险有关。
截止目前,依然没有恢复访问。
有一说一,美国政府的要求确实过于无理了。如果真要严格执行的话,恐怕 Anthropic 不得不要求所有用户手持美国身份证做活体认证了,这几乎可以说是死路一条,将是对 Anthropic 商业化的巨大打击。乐观来说,这件事应该会有转机的,最后总会有办法的吧。
Opus也够聪明
幸运的是,即便Fable现在用不了,Opus也已经够聪明了。
我开启了一个新的项目。由于我之前从未接触过这个技术框架,对其所使用的语言也一窍不通,因此我只能选择(几乎完全) Vibe Coding 的形式。
Opus向我展现了它那令人称赞的“长程”任务能力。我所要求的一切,它都做得很好。遇到一些问题、或者需要调整方案,只需要说几句话,然后去泡一杯咖啡,回来看它已经把一切安排得妥妥当当。
这是我第一次纯正感受 Vibe Coding 。之前的尝试,要么在一个巨大的商业化项目中难以展开拳脚,要么在我熟悉的技术领域内我想要一切尽在掌握,总之我是第一次完全把编程工作交给AI 。必须承认的是,很惊艳。
如果开玩笑说,“只需要一句话,AI就能帮你写出一个app”。
当然如果严格来说,作为人类工程师长久积累的知识和经验,仍然在 AI编程 中起到巨大作用。只不过,人类的工作内容变了。一方面依靠大脑巨大的上下文容量,从宏观层面指导方向和架构设计;一方面依靠灵活的手指和眼睛,从具体层面充当AI的人肉测试报告机。
降智的GPT
作为当今世界上最具竞争力的两家AI公司之一,OpenAI 的 GPT 也是非常优秀的产品。
在之前还在使用 Github Copilot 的时候,我就已经开始留意观察过这两家AI的区别。我长久积累下来感受是:
- GPT 像个文科生(或者商科毕业生),擅长文字表达,擅长处理客户关系,就算事没办成也把流程给你做漂亮了;
- Claude 像个理工男,人狠话不多,擅长解决问题,虽然有时候看起来不听话但最后你大概率会承认他才是对的。
而随着最近我逐渐开始使用完全体 Codex 和 Claude Code ,我逐渐发现他俩的区别还在加深,越来越符合我之前形成的印象。
有一段时间我只用 Codex ,我觉得 GPT-5.5 还是挺聪明的,大部分问题都能解决,但有时候也确实为它的啰嗦而感到烦恼。
而当我自从被Fable震撼到,开始主力使用 Claude Code 之后,我忽然产生了自我怀疑:我之前过的都是什么苦日子?!
最近我甚至感觉 GPT 有点蠢,甚至有点“美国大豆包”那意思了。最近几天,我几乎把 GPT 当做搜索引擎使用。
哎,这人呐,由俭入奢易,由奢入俭难。
而且 GPT 有个问题是 额度消耗太快了。我的主观感觉 GPT-5.5 的消耗量介于 Opus 4.8 和 Fable 5 之间,算是消耗比较快的了,甚至团队中有小伙伴表示额度不够用。
消失的Copilot
copilot 并没有它自己的模型(至少没有公认的顶尖模型),但是它作为中国人最容易获得的国外AI终端产品,它也非常值得讨论。
之前的很长一段时间里,可以说有一两年吧,我身边的同事大约有一大半都在用 copilot 。
可是自从6月1号修改了计费政策之后,消耗量与以前相比暴涨20倍,现在它已经变得几乎不可用了。我身边的同事也几乎没有再用它的了,即使有,也是用免费版 copilot 接入国产模型 API 。
我也遗憾地取消了我的年费订阅。微软很慷慨地按时间比例给我退费了,很舒心。不过美中不足的是,我付费时的美元汇率比我退款时贵好几毛,一来一去间汇率就损失了几十块。
刚退订时,感到最大的不适应是没有 inline suggestions 功能了。copilot 本身并没有提供接入第三方API来实现 inline suggestion 的能力。我寻找了一圈替代品,包括 continues, windsurf 没有一个可用的,这时我不得不承认,在 Agent 能力之外,inline suggestion 也是 copilot 的巨大竞争力之一。
如果 copilot 推出一个新的订阅套餐,例如 5美元每月,只提供无限量的 inline suggestion,我想我会很乐意续费的。但是现在,我觉得氛围编程也挺好的——确实该转变观念了。
掉队的Gemini
在 copilot 我试用过 Gemini 。我印象特别深刻:慢,究极慢。发一个任务给 Gemini ,它吭哧吭哧思考几十分钟,甚至有一次我吃个饭回来它还在思考。然而长时间思考也并没有带来准确性的提升,最后的结果依然不如其他模型。
最近我尝试调研了原生安卓开发。不得不说,至少在 Andriod Studio 中,也许是凭借Agent前端的优势,Gemini 在原生安卓开发这一领域表现还是不错的。
不过我的这番体验结果仅供参考,我用的是免费版,廉价模型虽然能表面上完成任务,但是实际运行后还是立马暴露错误。
超便宜的deepseek
deepseek-v4很出名。不是因为它有多聪明,而是因为它极致的便宜。
没有任何订阅套餐,纯粹以token用量计费,即便如此,综合使用成本依然比订阅套餐来的便宜。
甚至我自己简单计算了一下,如果拿我手头的 5090D v2 显卡,在本地运行一个 Qwen 27~32B 的模型,我的使用成本(只考虑电费)甚至可能比云端的 deepseek-v4-flash还贵一些。
甚至可以说 DeepSeek 不是在卖AI,而是在“卖电”。 DeepSeek 已经完全粉碎了小规模本地部署AI的意义。(当然一些非法用途、数据安全、或者多媒体用途除外)
它虽然远远不如国外顶尖模型,GPT Claude 它们那么聪明,但是它实在太便宜了,而且按用量计费,非常适合用来兜底,或者是日常工作的补充和简单任务的替代,能有效避免“万一哪天AI全面封锁后我们现有的AI编程模式彻底掉到地上”这个问题。
在 DeepSeek 降价后,小米退出的 Mimo 模型也贴身对打,完全参照 DeepSeek 定价。我没有亲自试用过,传言是在代码能力上比 ds 弱,但是胜在支持多模态。