《AI工具怎样选?》· 第一篇
假如把同一个问题分别交给ChatGPT、Claude和Gemini,再把三个答案并排放在一起,我们当然完成了一次比较。问题是,我们比较出来的究竟是什么?
也许只是三个系统在某一天、某个账户等级、某种默认设置下生成的三段文字。换一个模型,打开搜索或深度研究,把问题放进Project或Notebook,结果都可能改变。订阅计划也会影响可用的功能和使用限额。即使任何条件都没有变化,再问一次也未必得到完全相同的答案。
这种比较并非毫无意义。它可以观察某个具体任务中的一次表现,却承担不了“哪个AI最好”这样大的结论。后者听起来像是在比较三个固定物件,实际面对的是三个仍在扩张的产品系统。
一个名称下面藏着多少层东西
日常讨论常把公司、模型和产品混在一起。ChatGPT是用户使用的产品,其中可以有不同模型和工具;Claude既指Anthropic的模型家族,也指聊天产品,还延伸到Claude Code等工作环境;Gemini同样覆盖模型、聊天应用、Google服务中的AI功能以及研究工具。
至少有五个层次需要分开:
| 层次 | 需要问的问题 | 为什么会影响结果 |
|---|---|---|
| 模型 | 实际调用的是哪个模型、什么推理设置? | 能力、速度和用量消耗不同 |
| 模式 | 普通聊天、搜索、深度研究还是代理任务? | 系统取得资料和采取行动的方式不同 |
| 工作空间 | 单次对话、Project或Notebook? | 文件、指令与历史能否持续影响后续工作 |
| 计划 | 免费、个人付费还是组织计划? | 限额、模型、连接器和管理控制不同 |
| 入口 | 网页、手机、桌面、IDE还是终端? | 工具能够看见和改变的工作环境不同 |
这不是术语上的洁癖。假如一个人想整理二十份采访记录,真正有用的能力包括文件能否长期保存在同一项目、系统怎样检索资料、引用能否回到原文,以及下一次对话是否继续沿用项目指令。单独测试一道常识题,几乎看不出这些差异。
反过来,如果需求只是把一封邮件改得简洁一些,复杂的研究能力不一定带来额外价值。启动成本、响应速度和日常入口可能更重要。所谓最强能力,只有进入具体工作以后才获得意义。
同一道提示词并不总是公平
“统一提示词”看起来是最公正的评测方法。它确实控制了输入文字,却可能忽略产品本来提供的工作方式。
深度研究工具通常会先制定计划、搜索多个来源,再形成带引用的报告。普通聊天更适合迅速澄清问题。如果要求二者都只用一段提示、一次回复完成工作,表面条件相同,任务结构已经偏向其中一方。类似地,Gemini Notebook的核心价值在于围绕用户选择的来源进行回答;不给它资料,只问一个开放问题,无法测试它最重要的设计。
公平不等于强迫所有工具走同一条路径。更合理的做法是固定最终任务和证据要求,同时允许工具使用自己的原生流程。例如要准备一份关于澳大利亚成人钢琴学习市场的简报,可以规定:必须区分官方统计与行业估计,主要判断要有可打开的来源,列出尚未解决的问题,并把结果交付为可继续编辑的文档。至于工具通过研究计划、网页搜索还是Notebook完成,可以有所不同。比较的对象由“谁写出最好看的第一段”变成“谁更可靠地完成整项工作”。
好答案与好工具并不是一回事
一次回答的质量当然重要,但长期工具选择还包含几个经常被忽略的成本。
第一个是准备成本。为了得到可靠结果,需要上传多少资料、重新解释多少背景、整理多少指令?第二个是核查成本。引用能否直接打开,表格中的数字能否追到原始来源,系统有没有把推断写成事实?还有继续工作的成本:结果能否进入文档、代码库或团队流程,还是只能从聊天窗口复制出去重新整理。
错误恢复尤其重要。AI写错一句广告文案与误改一组生产代码,后果完全不同。后者需要差异审查、测试、权限限制和回退机制。若只对最终文本打分,这些决定工具是否可以用于真实工作的条件全部消失了。
因此,一个产品可能在某次回答中不够惊艳,却因为来源清楚、上下文稳定、修改容易审查,成为更可靠的日常选择。另一个产品偶尔给出非常出色的成稿,如果过程不可重建,未必适合高风险任务。这里没有矛盾:输出质量只是工具质量的一部分。
比较时还要计算人的时间
AI评测喜欢记录系统响应用了几秒,却很少计算使用者之后花了多久。研究报告在四分钟内生成,如果核对引用需要两个小时,它并没有四分钟完成。代码代理工作半小时,开发者又花半天理解大范围修改,也不能只以代理运行时间衡量效率。
人的时间至少分为三段:任务开始前准备材料,运行过程中给出必要判断,结果完成后核查、修改和整合。好的工具不一定让人完全退出。它更可能把人的注意力放在真正需要判断的位置,并减少无意义的搬运与重复解释。
这也是用户熟悉程度会改变比较结果的原因。一个已经把文档长期保存在Google Drive的人,Gemini与Google服务之间的连接可以减少很多转移工作。以GitHub为中心的开发团队会重视Issue、Pull Request、权限和代码审查是否处于同一环境。若评测者的材料和工作方式完全不同,同一个功能的价值自然不同。
所谓“客观排名”常常只是把这些个人条件藏了起来。承认条件并不会让比较变得主观随意,反而使结论能够被别人正确使用。
怎样做一次真正有用的个人比较
普通用户不需要建立大型基准测试。选择一个每月都会重复、而且结果容易检查的真实任务,通常已经足够。可以是一组固定资料的摘要、一篇短研究、一份数据整理,或者一个带测试的小型代码修改。
开始前先写清楚合格结果。它是否必须引用指定来源?能不能引入网页资料?最后需要什么格式?哪些错误不可接受?然后记录所用计划、模式和日期。每个工具至少做两次,因为一次顺利或一次失败都可能带有偶然性。
评估时不要急着给文笔打分。先检查事实和遗漏,再看用了多少人工时间。继续工作是否方便,也值得单独记录。最后问一个很朴素的问题:如果下周再做一次,我愿意在哪个环境里继续?
这个方法不会产生适合社交媒体传播的“全网第一”,但会得到更接近个人现实的答案。
三个工具应当怎样理解
截至本文核查时,ChatGPT Projects把对话、文件、项目指令、记忆和多种工具放在持续工作空间内;Claude Projects强调独立项目的聊天历史、知识库和项目指令;Google则把原NotebookLM更名为Gemini Notebook,继续发展以来源为中心的研究环境,并与Gemini应用逐步连通。
这些产品正在互相吸收能力,却还没有变成同一种东西。ChatGPT的边界向多工具工作空间和代理行动延伸;Claude把聊天、Projects、Research及Claude Code等环境连接起来;Gemini的优势结构与Google Search、Drive、Gmail、Docs和Notebook关系密切。这里只是在说明产品形态,并不等于宣布任何一方在具体任务中胜出。
真正值得比较的问题会更窄,也更有用:做深度研究时,谁给用户更合适的来源控制?面对自己的资料,Project与Notebook怎样处理证据?写长文或改代码,什么工作流更容易检查?本系列后面的文章将逐项处理这些问题。
结论:先固定任务,再允许答案不同
ChatGPT、Claude与Gemini当然可以比较,但不能把一次聊天的胜负扩张成对整个产品的判决。有效比较需要固定最终任务、资料范围、错误容忍度和交付要求,同时记录实际使用的模型、模式、计划与入口。
最后得到的也不应是一句永远有效的排名。比较真正要回答的是:在我的资料位置、工作习惯和风险条件下,哪个工具能用较少的人工整理,形成更容易核查、继续和修正的结果?
一旦问题这样提出,选择就不再围绕品牌忠诚,也不会被某次漂亮回答轻易带走。工具仍会快速变化,而判断有了相对稳定的支点。
主要资料
- OpenAI:Projects in ChatGPT
- OpenAI:ChatGPT Plans
- Anthropic:What are projects?
- Anthropic:Plans & Pricing
- Google:NotebookLM is now Gemini Notebook
- Google:Google AI plans
继续阅读:《AI工具怎样选?》系列目录
了解 Geoffrey Chen 的更多信息
订阅后即可通过电子邮件收到最新文章。