Anthropic Claude 3.5 Sonnet 升级,代码能力超越 GPT-4
摘要
SWE-Bench 测试中 Claude 3.5 Sonnet 得分 49%,超越 GPT-4o 的 42%。
正文
最新 SWE-Bench 评测显示,Claude 3.5 Sonnet 在真实代码修复任务中表现最佳。长上下文处理能力也获得好评。
相关资讯
- 不止一颗CPU?智能体经济时代,Arm对算力平台有了新理解 2026-09-16
- Claude独立破译370年前密文!仅44分钟,密码学家破防了 2026-09-16
- 全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型 2026-09-16
- 亚太唯一!腾讯云首次入选IDC MarketScape 全球托管边缘服务领导者类别 2026-09-16
- 担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」 2026-09-16
- 阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单 2026-09-16