最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
谷歌升级Android_Bench代码排行榜:Claude5斩获榜首:Gemini准确率与效率双落后
时间:2026-07-13 07:31:52 编辑:袖梨 来源:一聚教程网
7月9日,谷歌正式宣布对Android Bench代码开发者排行榜实施全面重构,核心举措是整合标准化的Harbor沙箱框架。该调整将全部测试迁移至高度隔离的安全运行环境,旨在降低全球开发者执行独立性能评估、灵活配置开发环境以及协作共享测试数据的技术门槛。随着底层架构升级,谷歌同步在GitHub平台开源整个基准测试套件,开放社区参与——开发者可自主提交定制化的Android开发任务及模型评测方案。
值得注意的是,在此次更新后的权威排名中,谷歌自研模型未达预期表现:Anthropic推出的旗舰级模型Claude Fable5以84.5%的准确率位居第一;OpenAI最新迭代模型GPT-5.5以80.2%的得分位列第二;而谷歌Gemini 3.1 Pro仅排在第五位。
虽然Gemini系列在单次推理成本方面仍具竞争力(Gemini 3.1 Pro单轮测试约87美元,显著低于头部竞品普遍超130美元的开销),但其轻量版本Gemini 3.5 Flash在处理百题规模评估数据集时却暴露明显瓶颈——单次完整运行耗时长达28小时,总成本攀升至165美元。
目前,构建以自主智能为核心的端到端开发工作流已成为业界主流方向。谷歌在这一关键移动生态基准测试中的相对滞后,客观上对其整体AI战略落地构成实质性技术压力。不过,依托公开透明的评测逻辑与Harbor沙箱框架的深度开放能力,Android Bench正加速成长为业内公认的、非商业导向的权威AI编程能力评估基础设施。
相关文章
- 别建“全公司AI知识库”了:公司真正需要蒸馏的是最强员工的认知 08-03
- 什么是Physical AI?智能机器时代已来临 08-03
- 吴恩达最新开源 AI 同事,在 Github 爆火了! 08-03
- 神经网络如何记忆和回忆?一篇 Nature 给的新启发 08-03
- AI 真的太贵了 08-03
- Loop才火了六周,AI Coding为什么又开始谈Graph? 08-03