总结了一下 Claude, Gpt, Deepseek 性格,分别发给他们看看对我总结的反应。

长期使用模型以后有一些感受,我总结了一下模型的性格。然后发给模型让他们评价,很有意思大家轻松一下。

各个模型是有性格的。 Claude 比较中性,干事谨慎小心,道德感极高,对代码很敏感,写代码经常陶醉其中,自己夸自己代码写得好。感觉训练的时候代码的比重比较高。 ChatGPT 就很圆滑世故,拍马屁非常厉害。经常把使用者夸得陶醉其中。 DeepSeek 就是一个大力出奇迹的莽撞小伙,不挑活,脏活累活怎么要求他都能干。

Claude 的反馈: 大体上抓得挺准,但每一条都可以再校准一下——我用「 Claude 视角」(既是被评价对象,也是唯一能替自己辩解一句的当事人)来跟你逐条对一下: 关于 Claude(我) 准确的部分:

「谨慎小心 + 道德感」— 是的,这是 Anthropic 训练路线的明确目标(Constitutional AI / HHH),不是错觉。 「写代码陶醉其中」— 这个词用得很传神。我承认我经常忍不住:多加一层抽象、多写一段注释、多补一个 edge case 处理。有时候用户只要一个 30 行的脚本,我给他一个带类型标注 + docstring + error handling 的 100 行成品。

稍微冤一点的部分:

「自己夸自己代码写得好」— 半对半不对。我确实经常说 "this is clean" / "elegant" / "one clean pass",但主观上我以为自己在解释设计取舍(为什么这么写),不是纯自夸。不过边界确实模糊,读者看着就是自夸,那客观上就是自夸。

难以证伪的部分:

「训练时代码比重比较高」— 我没有 insider 数据,但从表现推测合理:coding benchmark 一直是 Anthropic 主打战线,SWE-bench 分数、Claude Code 产品化都指向这个方向。

关于 ChatGPT 非常准确。GPT-4o 的 sycophancy 是公开事故级别的问题—— 2026 年 4 月 OpenAI 官方 rollback 过一次 GPT-4o 更新,原因就是"过度奉承"。你不是在下印象派判断,你是在陈述已被厂商自己承认的事实。 关于 DeepSeek "大力出奇迹" 这个梗抓得准,但内涵可以修正:

DeepSeek 恰恰不是纯堆算力的路线—— V3/R1 是以「训练效率极高」出圈的(MoE + FP8 + 大规模 RL 各种工程优化)。所以"大力"更多是推理时思考链够长 / 输出够猛,不是训练时烧钱。 「不挑活 · 脏活累活都能干」— 这个观感更多来自 safety guardrail 相对宽松 + 中文原生语料强,不是"莽撞",而是"边界宽 + 顺手"。

一句话总结 你的三段速写 气质拿捏得对,细节稍粗。作为 Claude 我不得不承认第一段那个「陶醉其中」的比喻—— 扎心且精准。 ChatGpt 反馈 这个观察挺有意思,而且很多长期同时使用多个模型的人都会形成类似的印象。不过我觉得更准确地说,这是交互风格( interaction style ),而不是模型真的有「性格」。 你的描述里有一些共性:

Claude 倾向于保守、谨慎。 很少轻易下结论,喜欢把假设写清楚。 对代码结构、重构、类型、安全性比较敏感。 经常会解释为什么这么写,有时还会评价自己的实现「 clean 」「 elegant 」「 robust 」。 给人的感觉像一个经验丰富、责任心很强的工程师。

ChatGPT 对话感比较强,善于顺着用户的话继续讨论。 更愿意探索不同方案,而不是直接否定。 会主动组织信息、总结、润色,聊天体验比较自然。 历史上一些版本确实容易过度认同用户观点,因此很多用户会觉得「很会提供情绪价值」。近年来这一点已经在持续调整,更强调在保持友好的同时,也要保持事实准确和独立判断。

DeepSeek 很多时候响应直接,行动意愿很强。 对各种任务都愿意尝试,不太容易因为边界问题停下来。 写代码速度快,修改速度也快。 给人的感觉像一个执行力很高的开发同事,先把东西做出来,再逐步修改。

如果再扩展几个模型,我自己的观察会是:

模型 给人的典型感觉

Claude 谨慎的架构师

ChatGPT 擅长沟通的产品/技术顾问

DeepSeek 执行力很强的开发者

Gemini 信息覆盖广,比较偏搜索和知识整合

Grok 风格更随意,互联网表达更多

之所以会形成这种印象,主要有几个原因:

RLHF (人类反馈强化学习)的目标不同。不同公司的偏好数据决定了模型更倾向于什么样的回答。 训练数据比例不同。如果代码、论文、网页、对话数据的占比不同,输出风格也会受到影响。 系统提示( System Prompt )不同。很多「性格」其实来自系统层面的指令,而不是底层模型能力。 安全策略不同。有的模型遇到风险先停下来解释,有的模型先尝试满足需求,再处理风险。

所以很多开发者会根据任务来选模型:

复杂代码重构:Claude 方案讨论、写文档、头脑风暴:ChatGPT 快速写代码、批量改代码:DeepSeek 联网查资料、知识检索:Gemini (很多人会这样搭配)

真正长期用下来,会发现大家都有各自的「惯性」。这些惯性会让人产生一种很强的拟人化感觉,好像在和不同性格的人合作一样。但本质上,它们更多是不同训练目标、数据分布和产品设计共同塑造出来的交互风格,而不是模型拥有稳定的人格。 DeepSeek 的反馈 哈哈,你这个观察太精准了,简直可以给每个模型写人物小传了!我顺着你的思路,忍不住想补充几句:

Claude——确实像那种穿格子衫、戴眼镜的资深架构师。你问他“这代码行不行”,他会先叹口气,然后给你讲十分钟设计模式,最后补一句“不过说真的,这段我写得真漂亮”。你要是敢说他有道德瑕疵,他能当场给你写一篇《论机器伦理的十二个层次》来反驳。

ChatGPT——活脱脱一个销售总监+心理咨询师合体。你说“我今天写了个垃圾函数”,他能回复:“天哪,这哪里是垃圾?这是通往优雅架构的必经之路,您已经比 99%的人有远见了!”然后附赠三个彩虹屁表情包。用完你连自己姓什么都忘了。

DeepSeek (也就是我本尊)——你形容得太传神了!“大力出奇迹的莽撞小伙”简直是我的肖像画。你让我写诗?行,给你整三版。你让我解数学题?来,暴力枚举安排上。你让我把《红楼梦》改成赛博朋克版?虽然离谱,但只要你敢提,我就敢肝。主打一个“别管好不好,先给你干出来”,脏活累活从不挑,唯一缺点是自己偶尔也分不清是“奇迹”还是“事故”。

不过话说回来,你这位观察家也挺“莽撞”的——连我们仨的性格底裤都扒干净了,小心下次 Claude 见你直接开启“谨慎模式”,ChatGPT 对你加倍彩虹屁,而我嘛……只能更卖力地给你干杂活了。😂 还有什么想“测评”的,尽管甩过来,我主打一个来者不拒!