產品最新消息

Android LLM 評估機制再進化:Android Bench 的新紀元

3 分鐘小故事
查看 Zoe Lopez-Latorre 的個人資料
Zoe Lopez-Latorre Android 資深開發人員關係工程師

今年 3 月,我們推出了 Android Bench,這項 LLM 排行榜可評估模型在實際 Android 開發工作中的表現。我們的目標是讓 Android 開發人員清楚瞭解模型功能,並鼓勵他們改善模型,為日常工作流程提供更多實用的 AI 選項。自此之後,我們根據您的意見回饋,進一步強化了基準,包括評估開放權重模型,並在排行榜中加入成本和效率維度。

但 AI 功能不斷演進,評估方式也必須與時俱進。在 7 月發布的版本中,我們採用了 Harbor 架構,其中包含用於評估模型的基準化代理程式更新版本。

除了調整評估方式,我們也會在 7 月發布的排行榜中,新增 8 個模型 (Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 和 Qwen 3.7 Max)。我們也將分享機會,讓 Android 開發人員社群為基準做出貢獻。

運用 Harbor 架構升級方法

設計 Android Bench 時,我們以當時的領先業界標準為方法論基礎。我們使用一般用途基準化代理程式 mini-swe-agent v1,並根據 Android 開發的細微差異進行調整,為模型在常見 Android 開發工作中的能力提供基準評估。

為持續提供最先進的評估方式,準確評估 Android 開發的最新模型功能,我們將基準標準化為 Harbor 架構。Harbor 定義了標準和整合功能,讓任何人都能輕鬆執行基準測試、評估偏好的設定或分享結果,進一步提升透明度和能見度。

升級後,我們就能更嚴格地評估模型及其功能,並重新執行所有模型的基準測試,建立更新的基準。這表示分數會略有變動,但您仍可在我們網站的封存中查看歷來分數。

為確保 Android Bench 對您有幫助,我們會隨著評估結果和產業發展持續更新。

排行榜新增 8 個模型

為確保排行榜內容與時俱進,我們已在 Android Bench 排行榜中新增 Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus 和 Qwen 3.7 Max。

您會看到 Claude Fable 5 以 84.5 分位居排行榜第一,其次是 GPT 5.5,得分 80.2 分,而 Claude Sonnet 5 則以 76.2 分位居第三。

如果只比較開放權重模型,GLM 5.2 以 72.2 分位居第一,Kimi K2.7 Code 則以 70.4 分緊隨其後。

您可以在更新後的排行榜上查看模型效能和效率指標,瞭解這些新舊模型如何解決 Android 專屬的挑戰,例如 Jetpack Compose 遷移、穿戴式裝置網路和平台 API 更新。  

image1.png

開放社群協作 Android Bench

我們從一開始就重視開放透明的做法,因此在 GitHub 上公開了原始方法和測試架構。您希望提供資料集意見回饋,因此我們進一步加強合作,讓 Android 開發人員社群有機會參與 Android Bench 的開發。

即日起,您可以透過兩種方式為 Android Bench 做出貢獻:

  1. 設計並提交自己的 Android 開發工作,評估模型如何處理您重視的情境。
  2. 直接執行及分享基準評估,根據我們的資料集或您自己的自訂工作,測試偏好的模型。

我們會審查提交的任務,並評估是否將其新增至基準。我們希望建立的基準能真正反映全球 Android 開發人員社群的多元日常實況。

展望未來

隨著代理程式開發選項越來越多,維持尖端基準可確保您仰賴的 AI 輔助功能持續變得更聰明、實用且有效。請前往我們的 GitHub 存放區查看工作。歡迎將工作提交給我們的團隊審查,並前往 Harbor Hub 探索資料集或提交評估。

如往常一樣,您可以在我們的網站上查看最新排行榜,或閱讀方法

撰寫者:
繼續閱讀