Anthropic通过Fable 5.1和Mythos 5.1增强Claude
Anthropic继续在性能方面发力,推出了Claude的两个新版本。Fable 5.1针对付费用户,增强了编程、研究和复杂任务的能力,而Mythos 5.1则面向经过验证的有限组织。
两个模型,相同的技术基础
Anthropic于9月1日发布了新的Claude Fable 5.1和Claude Mythos 5.1模型,仅在之前版本推出三个月后。
尽管名称不同,这两个模型基于相同的基础架构。它们的主要区别在于安全级别和访问条件,这些条件限制了它们的能力。
Fable 5.1是更广泛使用的版本,而Mythos 5.1则在某些专业领域提供更高级的功能,因此仅限于特定组织。
Claude想要解决持久性任务
通过Fable 5.1,Anthropic主要希望提高Claude管理长时间和复杂任务的能力。
该模型旨在连续执行多个步骤,使用不同的工具,并在较长时间内持续工作。它可以被用于计算项目、进行研究、审查大量文档或处理电子表格和演示文稿。
另一个突出的进展是,当一个步骤失败时,该模型能够更好地调整其方法以继续任务,而不是将整个任务视为完成。
编程方面的显著进展
编程是Anthropic声称获得最大收益的领域之一。
在公司对Terminal-Bench-Science 0.1进行的测试中,该测试评估人工智能代理在计算环境中进行科学研究的能力,Fable 5.1达到了52.6%,而Fable 5为24.7%。
在Terminal-Bench 4.0中,针对自主执行的编程任务,新版本获得了55.8%,而其前身为42%。
不过,这些数字需要谨慎解读:它们是Anthropic在其自身评估中提供的结果。
Fable 5.1对订阅者开放
与Mythos 5.1不同,Fable 5.1面向拥有Claude付费计划的普通用户。
这种可用性反映了Anthropic逐步将其模型的高级能力转向常见的专业用途,特别是在软件开发、文档分析和需要多种工具的工作中。
然而,该模型在某些被视为敏感的领域仍然受到额外限制。
Mythos 5.1采取控制访问策略
Mythos 5.1采取了不同的方法。根据Anthropic的说法,其在某些专业领域的额外能力使得其访问限制在经过验证的组织之内。
这种分离使公司能够在受控环境中提供更强大的技术,同时为面向公众的版本保留更多的保护措施。
通过Fable 5.1和Mythos 5.1,Anthropic旨在同时满足专业用户的需求和与最敏感应用相关的控制要求。
-
19:32
-
19:15
-
18:48
-
18:32
-
18:15
-
17:50
-
17:33
-
17:15
-
16:47
-
16:33
-
16:15
-
16:02
-
15:50
-
15:48
-
15:33
-
15:23
-
15:15
-
14:46
-
14:30
-
14:29
-
14:22
-
14:10
-
14:02
-
13:45
-
13:41
-
13:37
-
13:30
-
13:13
-
13:08
-
12:50
-
12:28
-
12:27
-
12:10
-
11:47
-
11:33
-
11:15
-
10:48
-
10:30
-
10:26
-
10:23
-
10:10
-
10:01
-
09:57
-
09:45
-
09:45
-
09:44
-
09:25
-
09:09
-
09:06
-
08:45
-
08:26
-
08:19
-
08:10
-
08:05
-
07:47
-
07:32
-
07:15