介绍
开发先进 AI 技术(尤其是聊天机器人)的竞赛正吸引着众多参与者。OpenAI 的 ChatGPT 就是一个典型的例子。当它在 2023 年进入聊天机器人领域时,一度成为人们谈论的焦点。在生成式 AI 技术的驱动下,它已成为各种任务中最常用的工具之一,涵盖了从撰写电子邮件到编写代码的广泛领域。
另一个高性能聊天机器人于 2023 年初问世——由谷歌和亚马逊支持的初创公司 Anthropic AI 推出的 Claude。Claude 的第二个版本 Claude 2 在推出时拥有超过 350,000 名等待名单用户,是目前最火爆的聊天机器人之一。
快进到 2024 年,Anthropic AI 于 3 月 3 日发布了 Claude 3,这是其 AI 模型家族的最新成员,预计将在广泛的认知问题上树立新的行业基准。
在这篇文章中,我们将详细讨论 Claude 3,探讨它与 ChatGPT-4 的对比情况以及一些局限性。
但在我们深入了解之前,先来熟悉一下 Anthropic AI 和 Claude 的不同版本。
什么是 Anthropic AI?
Anthropic AI 成立于 2021 年,是一家总部位于加利福尼亚州旧金山的人工智能安全与研究初创公司。该品牌的主要重点是研发 LLM(即大语言模型)以及利用这些模型构建聊天机器人。Claude 就是其中之一,它是 OpenAI ChatGPT 的有力竞争对手。Slack、Quora 和 Notion 等品牌已经认识到 Claude 2 的潜力,并将其集成到了各自的系统中。
Anthropic 在开发技术时采取了宪法人工智能(Constitutional AI)方法,利用一个框架确保模型以更安全、诚实和有益的方式做出反应。
Anthropic AI 简史
Anthropic AI 是 Dario Amodei 和 Daniela Amodei 的心血结晶,他们分别曾担任 OpenAI 的研究副总裁和安全与政策副总裁。
2021 年,Anthropic AI 进行了初步融资,筹集了 1.24 亿美元,投资方包括 Jaan Tallin(Skype 联合创始人)。2023 年 5 月,Anthropic AI 从科技巨头谷歌处获得了 4.5 亿美元的投资。同年 9 月,亚马逊承诺投入高达 40 亿美元,旨在让亚马逊员工和云客户能够从 Anthropic AI 获得早期使用权,而 Anthropic AI 将完全依赖亚马逊的云服务来训练未来的模型。
什么是 Claude AI?
Claude 是由 Anthropic 开发的一款 AI 聊天机器人。它的设计初衷是生成文本内容,并像人类一样进行对话。其第一个版本由 LLM Claude 1.3 驱动,于 2023 年 3 月发布。同年 5 月,Claude 将其内容处理宽度从 9,000 个词元(tokens)扩展到了 100,000 个词元。
不久之后的 7 月,推出了第二个版本——Claude 2,它比其前身更大、更强大。Claude 2 能够连接海量数据,从而进行趋势预测、文档对比,甚至执行问答任务。例如,用户可以上传技术文档,如代码库或长篇文学作品。Claude 2 可以处理大约 75,000 个单词。随后便是 Claude 3,它设定了新的行业标准,能够处理 200,000 个单词,并且比之前版本大幅减少了“幻觉”现象。

什么是 Claude 3?
2024 年 3 月 4 日,Anthropic AI 推出了其 AI 模型家族的最新成员——Claude 3,它“在广泛的认知任务上设定了新的行业基准。”
Claude 3 通过公共网页(包括维基百科文章和书籍)的海量文本数据进行训练。Anthropic 利用强化学习和人类反馈来更好地预测其回复序列中下一个最可能的单词。
Claude 3 是一个由三个 AI 模型组成的系列,每个模型具有不同的性能能力,允许用户在成本、速度和智能之间取得适当的平衡。所有模型在内容创作、代码生成方面都具有令人印象深刻的能力,甚至能使用多种语言进行对话。
Claude Haiku
Haiku 被描述为“轻量且快速”,是 Claude 家族中最紧凑、最快速的模型。它非常适合那些需要速度且注重成本效益的任务。不出所料,它是三个 Claude 3 模型中性能最低的一个。
Claude Sonnet
Sonnet 被描述为“勤奋高效”,是三个模型中的中坚力量。它在认知问题上表现强劲,且处理速度比 Opus 更快。它的目标是在速度和性能之间取得平衡,更倾向于服务企业任务,如数据处理、质量控制和产品推荐。
Claude Opus
Opus 被描述为“强大”,是三个模型中最智能的一个,在许多 AI 系统评估基准上表现优于 Sonnet 和 Haiku。在基础数学或研究生水平的专家推理任务中,它甚至超越了竞争对手的模型。
所有三个模型都经过测试,证明比它们的前辈更快、更智能。据 Anthropic 称,“Opus 和 Sonnet 现已可在 claude.ai 和 Claude API 中使用,目前已在 159 个国家/地区提供服务。Haiku 也将很快推出。”

Claude 3 与同行相比如何?
Claude Opus 模型在数学、推理和专家知识测试等大多数常见评估基准上均超过了其他 AI 系统。它还展现出了类似人类的理解力和复杂问题的流畅处理能力。Claude 与其他仅关注性能的同行相比,一个关键的区别在于它采用了宪法人工智能(Constitutional AI)。这三个 Claude 模型在设计上会监控风险并分析道德考量。与 GPT-3.5、GPT-4、Gemini Ultra 或 Gemini Pro 等其他模型相比,Claude 3 模型在代码生成、内容创作,甚至法语、西班牙语和日语等非英语语言的熟练度等各种任务和问题上都表现出色。
Claude 模型不仅支持多语言,还具备视觉能力。由于它们接受了各类视觉数据的训练,这些模型能够有效地分析和推断各种视觉内容中的信息。例如,它能够解读 AI2D 科学图表等任务中所展示的视觉数据,并在零样本(zero-shot)和少样本(few-shot)设置中达到高准确率。

Anthropic 提供的 Claude 3 多模态视觉能力基准图表
现在,让我们来看看全局!
Claude 3 对比 ChatGPT-4
Claude 3(确切地说是 Claude Opus)和 GPT-4 在 HumanEval(编码)、MMLU(本科水平知识)和 GSM8K(小学数学)等 10 项 AI 基准测试中进行了运行对比。如表所示,Claude 3 以微弱优势击败了包括 GPT-4 在内的竞争对手。例如,Opus 在 GSM8K 上比 GPT-4 高出 3%,在 HumanEval 上高出 17.9%。数据说明了一切,Claude 在所有 10 项基准测试中均超越了 GPT-4。

10 项 AI 基准测试
另一个值得注意的方面是单词计数。正如前面讨论的那样,Claude 3 最多可以处理 200,000 个单词,而 GPT-4 的限制为 64,000 个单词。这意味着 Claude 拥有更大的“上下文窗口”,能够记住更多的对话内容,并能生成更长的文本。这对于处理海量数据集和文档的企业任务来说是一个巨大的优势。
像 GPT-4 这样的聊天机器人所带来的另一个问题是隐私隐忧。大多数 GPT 用户都知道,用户与机器人进行的对话会被保存下来用于训练模型,以产生更准确的结果。但对于敏感信息而言,这可能会引发担忧。相反,Claude 不使用对话来训练模型,并在 90 天内从后端删除提示词(prompts)和输出结果。
Claude 3 的局限性
据早期用户反馈,Claude 3 在指令类任务或回答事实性问题方面表现良好。但在处理数学和复杂的推理问题时,它有时会感到吃力。此外,还存在一些响应带有偏见的例子。
Claude 3 目前也是市场上最昂贵的模型,但有讨论称在不久的将来会推出更实惠的计划。
结论
Anthropic AI 的研究人员旨在使生成式 AI 更加稳定和实用。借助宪法人工智能的力量,他们不仅旨在改进响应质量,还使模型更容易为用户所理解。就像能够理解正确响应的人类一样,Claude 3 有望模拟人类的反应。
快去亲自体验一下吧!请访问 www.claude.ai 并开始免费对话!每天的提示次数将有限制,如果您希望使用更多次数,可以选择每月 20 美元的 Claude Pro 计划。
敬请关注更多精彩内容。我们下期再见!



