产品动态

不断完善 Android 大语言模型衡量标准:Android Bench 迈入新纪元

3 分钟阅读时间
查看 Zoe Lopez-Latorre 的个人资料
Zoe Lopez-Latorre 高级开发者关系工程师,Android

早在 3 月份,我们就推出了 Android Bench,这是我们针对实际 Android 开发任务的大语言模型排行榜。我们的目标是提高 Android 开发中模型功能的透明度,并鼓励模型改进,以便为您提供更多实用的 AI 选项,帮助您完成日常工作流程。此后,我们根据您的反馈意见改进了基准,包括评估 开放权重模型,并在排行榜中添加了成本和效率维度。 

但 AI 功能不断发展,衡量标准也需要随之改进。在 7 月份的版本中,我们采用了 Harbor 框架,其中包括用于评估模型的基准代理的更新版本。 

除了对评估进行此项更改之外,在 7 月份的版本中,我们还在排行榜中添加了 8 个新模型(Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 和 Qwen 3.7 Max )。我们还为 Android 开发者社区的成员提供了参与基准的机会。

使用 Harbor 框架升级我们的方法

在设计 Android Bench 时,我们以当时领先的行业标准为基础制定了方法。我们使用了通用基准代理 mini-swe-agent v1,并根据 Android 开发的细微差别对其进行了调整,以便为常见 Android 开发任务的模型功能提供基准衡量标准。

为了继续为您提供前沿评估,准确衡量 Android 开发中最新的模型能力,我们正在将基准标准化为 Harbor 框架。Harbor 定义了标准和集成,让任何人都可以轻松运行基准测试、评估其首选设置或分享结果,从而为您提供更高的透明度和曝光度。

此次升级使我们能够更严格地评估模型及其功能,并且我们重新运行了所有模型的基准,以建立更新后的基准。这意味着评分会发生细微变化,但您仍然可以在我们网站上的 归档中查看历史评分。

我们希望确保 Android Bench 对您有所帮助,因此随着评估和行业的发展,我们将不断对其进行更新。

在排行榜中添加 8 个新模型

为了确保排行榜保持最新状态,我们已将 Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 和 Qwen 3.7 Max 添加到 Android Bench 排行榜中。

您会看到,Claude Fable 5 以 84.5 分位居排行榜榜首,其次是 GPT 5.5 ,得分为 80.2,Claude Sonnet 5 以 76.2 分位列第三。

如果仅比较开放权重模型,GLM 5.2 以 72.2 分位居榜首,其次是 Kimi K2.7 Code ,得分为 70.4。

您可以查看更新后的排行榜中的模型性能和效率指标,了解这些新模型和之前的模型如何应对 Android 特有的挑战,例如 Jetpack Compose 迁移、穿戴式设备网络和平台 API 更新。  

image1.png

向社区开放 Android Bench

从一开始,我们就非常重视开放透明的方法,因此我们在 GitHub 上公开了原始方法和测试工具。您一直希望有一种方法可以针对我们的数据集提供反馈,因此现在我们更进一步,让 Android 开发者社区的成员有机会参与 Android Bench 的建设。

即日起,您可以通过以下两种方式为 Android Bench 做出贡献:

  1. 设计并 提交您自己的 Android 开发任务,以评估模型如何处理您关心的场景。
  2. 亲自 _运行并分享基准评估_,针对我们的数据集或您自己的自定义任务测试您首选的模型。

我们将审核提交的任务,并评估是否将其添加到基准中。我们希望构建一个真正反映全球 Android 开发者社区多样化日常现实的基准。

未来计划

随着代理开发选项越来越多,保持最先进的基准可确保您依赖的 AI 辅助功能变得越来越智能、实用和高效。前往我们的 GitHub 代码库查看任务。我们邀请您向我们的团队提交任务以供审核,您还可以查看 Harbor Hub 以探索数据集或提交评估。

与往常一样,您可以在我们的网站上找到 更新后的排行榜,或阅读 方法

作者:
继续阅读