哈希力量归集文库路径访问：首页 > 机器智能 > NLP/LLM大模型 • GAI观察员

刚刚曝光的Claude3，直击OpenAI最大弱点

宛辰 ☉ 文来源：极客公园 2024-03-05 @ 哈希力量

【小哈划重点：Anthropic在159个国家开放使用Claude3系列的两款模型（Opus和Sonnet），最强版本Haiku也即将推出。联合创始人Dario Amodei and Daniela Amodei表示，Claude3的发布再次表明，Anthropic更像是一家企业公司，而不是一家消费者公司。】

企业级SOTA大模型，Anthropic的Claude3释放了哪些信号？

作为OpenAI GPT3研发负责人的创业项目，Anthropic被视为最能与OpenAI抗衡的一家创业公司。

当地时间周一，Anthropic发布了一组Claude3系列大模型，称其功能最强大的模型在各种基准测试中均优于OpenAI的GPT-4和Google的Gemini 1.0 Ultra。

但是，能处理更复杂的推理任务、更智能、更快响应，这些跻身大模型Top3的综合能力只是Claude3的基本功。

Anthropic致力于成为企业客户的最佳拍档。

这是首先体现在Claude3是一组模型：Haiku、Sonnet和Opus，让企业客户根据自身场景选择不同性能、不同成本的版本。

其次，Anthropic强调自家模型是最安全的。Anthropic总裁Daniela Amodei介绍，在Claude3的训练中引入了一种叫做「宪法人工智能」的技术，增强其安全、可信、可靠。

在看完Claude3的技术报告后，爱丁堡大学大模型和推理博士生符尧称，Claude3在一些复杂推理的基准测试上表现尤其显著，尤其在金融和医疗领域，作为一家To B公司，Anthropic选择优化最挣钱的领域。

现在，Anthropic在159个国家开放使用Claude3系列的两款模型（Opus和Sonnet），最强版本Haiku也即将推出。同时，Anthropic也通过亚马逊和谷歌的云平台提供服务，后者曾分别向Anthropic注资40亿美元和20亿美元。

联合创始人Dario Amodei and Daniela Amodei表示，Claude3的发布再次表明，「Anthropic更像是一家企业公司，而不是一家消费者公司。」｜图片来源：Anthropic

更智能、响应更快的Claude3家族：Opus、Sonnet和Haiku

据Anthropic官网，Claude3是一系列模型，包含三种最先进的模型：Claude3 Haiku、Claude3 Sonnet和Claude3 Opus，允许用户为其特定应用选择智能、速度和成本的最佳平衡。

在模型的通用能力上，Anthropic称Claude3系列「为广泛的认知任务树立了新的行业基准」，在分析和预测、细致内容的生成、代码生成以及西班牙语、日语和法语等非英语语言对话方面，现实出更强大的能力，在任务响应上也更及时。

其中，Claude3 Opus是这组模型中最智能的模型，尤其在高度复杂的任务处理上。Opus在大多数常见的评测基准中都优于同行，包括本科水平专家知识 (MMLU)、研究生水平专家推理 (GPQA)、基础数学 (GSM8K) 等。它在复杂任务上表现出接近人类水平的理解力和流畅性，是目前Anthropic对于通用智能最前沿的探索，「展示了生成式人工智能的外部极限」。

Claude3模型家族｜图片来源：Anthropic

Claude3 Sonnet在智能水平和响应速度之间实现了理想的平衡，尤其对于企业场景下的任务。与同类产品相比，它以更低的成本提供了强大的性能，并且专为大规模人工智能部署中的高耐用性（high endurance）而设计。对于绝大多数工作负载，Sonnet的速度比Claude2和Claude2.1快2倍，且智能水平更高。它擅长执行需要快速响应的任务，例如知识检索或销售自动化。

Claude3 Haiku是最紧凑的模型，并且也最具成本效益。并且，它的响应速度也很快，可以在不到三秒的时间内阅读arXiv上包含图表、图形的信息以及数据密集的研究论文（约10k token）。

瞄准企业客户的迭代

联合创始人Daniela Amodei介绍，除了通用智能的进步，Anthropic特别关注企业客户把生成式AI集成到他们的业务时，所面临的许多挑战。针对企业客户，Claude3家族在视觉能力、准确性、长文本输入和安全方面，都有进步。

很多企业客户的知识库拥有多种格式，PDF、流程图或演示幻灯片。现在，Claude3系列模型可以处理各种视觉格式的内容，包括照片、图表、图形和技术图表。

Claude3还优化了准确性和长文本窗口的能力。

在准确性上，Anthropic使用了大量复杂的事实问题来针对当前模型中已知的弱点，将答案分为正确答案、错误答案（或幻觉）和承认不确定性。相应地，Claude3模型表示它不知道答案，而不是提供不正确的信息。其中最强的版本Claude3 Opus在具有挑战性的开放式问题上的准确性（或正确答案）上，比Claude2.1提高了一倍，同时也减少了错误答案的水平。