Nowości dotyczące produktów

Zmiany w sposobie pomiaru modeli LLM na Androidzie: nowa era Android Bench

3 minuty czytania
Wyświetl profil użytkownika Zoe Lopez-Latorre
Zoe Lopez-Latorre Senior Developer Relations Engineer, Android

W marcu wprowadziliśmy Android Bench – nasz ranking modeli LLM do zadań związanych z tworzeniem aplikacji na Androida. Naszym celem było zapewnienie przejrzystości w zakresie możliwości modeli w tworzeniu aplikacji na Androida oraz zachęcenie do ich ulepszania, aby zapewnić Ci bardziej przydatne opcje AI w codziennej pracy. Od tego czasu ulepszyliśmy testy porównawcze na podstawie Twoich opinii, w tym oceniliśmy modele open-weight i dodaliśmy do rankingu wymiary kosztów i wydajności. 

Możliwości AI stale się rozwijają, a pomiary muszą za nimi nadążać. W ramach naszej lipcowej wersji wprowadziliśmy platformę Harbor, która zawiera zaktualizowaną wersję agenta testów porównawczych używanego do oceny modeli. 

Oprócz tej zmiany w ocenie w lipcowej wersji dodajemy do rankingu 8 nowych modeli (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max). Udostępniamy też możliwości, dzięki którym Ty i społeczność programistów na Androida możecie współtworzyć testy porównawcze. 

Ulepszanie metodologii za pomocą platformy Harbor

Projektując Android Bench, oparliśmy naszą metodologię na wiodących standardach branżowych dostępnych w tamtym czasie. Użyliśmy mini-swe-agent v1, agenta testów porównawczych do zwykłych obciążeń, i dostosowaliśmy go do niuansów tworzenia aplikacji na Androida, aby zapewnić podstawowy pomiar możliwości modeli w przypadku typowych zadań związanych z tworzeniem aplikacji na Androida.

Aby nadal zapewniać Ci najnowocześniejsze oceny, które dokładnie mierzą najnowsze możliwości modeli w tworzeniu aplikacji na Androida, standaryzujemy nasze testy porównawcze na platformie Harbor. Harbor określa standardy i integracje, które ułatwiają każdemu przeprowadzanie testów porównawczych, ocenianie preferowanych konfiguracji i udostępnianie wyników, co zapewnia dodatkową przejrzystość i widoczność.

Ta aktualizacja umożliwia nam bardziej rygorystyczną ocenę modeli i ich możliwości. Ponownie przeprowadziliśmy testy porównawcze na wszystkich modelach, aby ustalić zaktualizowaną linię bazową. Oznacza to niewielką zmianę w punktacji, ale nadal będzie można wyświetlać historyczne wyniki w archiwum na naszej stronie.

Chcemy, aby Android Bench był dla Ciebie przydatny, dlatego będziemy go stale aktualizować w miarę rozwoju naszych ocen i branży.

Poszerzanie rankingu o 8 nowych modeli

W ramach naszego zobowiązania do utrzymywania aktualności rankingu Android Bench dodaliśmy do niego modele Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max. 

Zobaczysz, że Claude Fable 5 znajduje się na szczycie rankingu z wynikiem 84,5, a za nim GPT 5.5 z wynikiem 80,2 i Claude Sonnet 5 na 3. miejscu z wynikiem 76,2.

Jeśli porównamy tylko modele open-weight, GLM 5.2 jest na szczycie z wynikiem 72,2, a za nim Kimi K2.7 Code z wynikiem 70,4.

Możesz sprawdzić dane dotyczące wydajności i efektywności modeli w zaktualizowanym rankingu, aby zobaczyć, jak te nowe i poprzednie modele radzą sobie z wyzwaniami związanymi z Androidem, takimi jak migracje do Jetpack Compose, sieci na urządzeniach do noszenia i aktualizacje interfejsu API platformy.  

image1.png

Udostępnianie Android Bench społeczności

Od początku cenimy otwarte i przejrzyste podejście, dlatego udostępniliśmy naszą oryginalną metodologię i platformę testową w GitHubie. Poprosiliście o możliwość przekazywania opinii na temat naszego zbioru danych, dlatego robimy kolejny krok w kierunku współpracy, dając Wam, społeczności programistów na Androida, możliwość kształtowania Android Bench.

Od dziś możesz współtworzyć Android Bench na 2 sposoby:

  1. Projektuj i przesyłaj własne zadania związane z tworzeniem aplikacji na Androida, aby ocenić, jak modele radzą sobie w scenariuszach, które są dla Ciebie ważne.
  2. _Przeprowadzaj i udostępniaj oceny testów porównawczych_ z pierwszej ręki, testując preferowane modele na podstawie naszego zbioru danych lub własnych zadań niestandardowych.

Będziemy sprawdzać przesłane zadania i oceniać, czy zostaną dodane do testów porównawczych. Mamy nadzieję, że uda nam się stworzyć testy porównawcze, które będą odzwierciedlać różnorodne, codzienne realia globalnej społeczności programistów na Androida.

Co dalej

W miarę jak pojawia się coraz więcej opcji rozwoju agentów, utrzymywanie najnowocześniejszych testów porównawczych zapewnia, że pomoc AI, na której polegasz, staje się coraz inteligentniejsza, bardziej przydatna i skuteczniejsza. Aby sprawdzić zadania, przejdź do naszego repozytorium GitHub. Zachęcamy do przesłania zadania do sprawdzenia przez nasz zespół. Możesz też przejść do Harbor Hub, aby zapoznać się ze zbiorem danych lub przesłać oceny.

Jak zawsze, zaktualizowany ranking i metodologię znajdziesz na naszej stronie. 

Napisane przez:
Czytaj dalej