Zmiany w sposobie pomiaru modeli LLM na Androidzie: nowa era Android Bench
3 minuty czytania
W marcu wprowadziliśmy Android Bench – nasz ranking modeli LLM do zadań związanych z tworzeniem aplikacji na Androida. Naszym celem było zapewnienie przejrzystości w zakresie możliwości modeli w tworzeniu aplikacji na Androida oraz zachęcenie do ich ulepszania, aby zapewnić Ci bardziej przydatne opcje AI w codziennej pracy. Od tego czasu ulepszyliśmy testy porównawcze na podstawie Twoich opinii, w tym oceniliśmy modele open-weight i dodaliśmy do rankingu wymiary kosztów i wydajności.
Możliwości AI stale się rozwijają, a pomiary muszą za nimi nadążać. W ramach naszej lipcowej wersji wprowadziliśmy platformę Harbor, która zawiera zaktualizowaną wersję agenta testów porównawczych używanego do oceny modeli.
Oprócz tej zmiany w ocenie w lipcowej wersji dodajemy do rankingu 8 nowych modeli (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max). Udostępniamy też możliwości, dzięki którym Ty i społeczność programistów na Androida możecie współtworzyć testy porównawcze.
Ulepszanie metodologii za pomocą platformy Harbor
Projektując Android Bench, oparliśmy naszą metodologię na wiodących standardach branżowych dostępnych w tamtym czasie. Użyliśmy mini-swe-agent v1, agenta testów porównawczych do zwykłych obciążeń, i dostosowaliśmy go do niuansów tworzenia aplikacji na Androida, aby zapewnić podstawowy pomiar możliwości modeli w przypadku typowych zadań związanych z tworzeniem aplikacji na Androida.
Aby nadal zapewniać Ci najnowocześniejsze oceny, które dokładnie mierzą najnowsze możliwości modeli w tworzeniu aplikacji na Androida, standaryzujemy nasze testy porównawcze na platformie Harbor. Harbor określa standardy i integracje, które ułatwiają każdemu przeprowadzanie testów porównawczych, ocenianie preferowanych konfiguracji i udostępnianie wyników, co zapewnia dodatkową przejrzystość i widoczność.
Ta aktualizacja umożliwia nam bardziej rygorystyczną ocenę modeli i ich możliwości. Ponownie przeprowadziliśmy testy porównawcze na wszystkich modelach, aby ustalić zaktualizowaną linię bazową. Oznacza to niewielką zmianę w punktacji, ale nadal będzie można wyświetlać historyczne wyniki w archiwum na naszej stronie.
Chcemy, aby Android Bench był dla Ciebie przydatny, dlatego będziemy go stale aktualizować w miarę rozwoju naszych ocen i branży.
Poszerzanie rankingu o 8 nowych modeli
W ramach naszego zobowiązania do utrzymywania aktualności rankingu Android Bench dodaliśmy do niego modele Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max.
Zobaczysz, że Claude Fable 5 znajduje się na szczycie rankingu z wynikiem 84,5, a za nim GPT 5.5 z wynikiem 80,2 i Claude Sonnet 5 na 3. miejscu z wynikiem 76,2.
Jeśli porównamy tylko modele open-weight, GLM 5.2 jest na szczycie z wynikiem 72,2, a za nim Kimi K2.7 Code z wynikiem 70,4.
Możesz sprawdzić dane dotyczące wydajności i efektywności modeli w zaktualizowanym rankingu, aby zobaczyć, jak te nowe i poprzednie modele radzą sobie z wyzwaniami związanymi z Androidem, takimi jak migracje do Jetpack Compose, sieci na urządzeniach do noszenia i aktualizacje interfejsu API platformy.
Udostępnianie Android Bench społeczności
Od początku cenimy otwarte i przejrzyste podejście, dlatego udostępniliśmy naszą oryginalną metodologię i platformę testową w GitHubie. Poprosiliście o możliwość przekazywania opinii na temat naszego zbioru danych, dlatego robimy kolejny krok w kierunku współpracy, dając Wam, społeczności programistów na Androida, możliwość kształtowania Android Bench.
Od dziś możesz współtworzyć Android Bench na 2 sposoby:
- Projektuj i przesyłaj własne zadania związane z tworzeniem aplikacji na Androida, aby ocenić, jak modele radzą sobie w scenariuszach, które są dla Ciebie ważne.
- _Przeprowadzaj i udostępniaj oceny testów porównawczych_ z pierwszej ręki, testując preferowane modele na podstawie naszego zbioru danych lub własnych zadań niestandardowych.
Będziemy sprawdzać przesłane zadania i oceniać, czy zostaną dodane do testów porównawczych. Mamy nadzieję, że uda nam się stworzyć testy porównawcze, które będą odzwierciedlać różnorodne, codzienne realia globalnej społeczności programistów na Androida.
Co dalej
W miarę jak pojawia się coraz więcej opcji rozwoju agentów, utrzymywanie najnowocześniejszych testów porównawczych zapewnia, że pomoc AI, na której polegasz, staje się coraz inteligentniejsza, bardziej przydatna i skuteczniejsza. Aby sprawdzić zadania, przejdź do naszego repozytorium GitHub. Zachęcamy do przesłania zadania do sprawdzenia przez nasz zespół. Możesz też przejść do Harbor Hub, aby zapoznać się ze zbiorem danych lub przesłać oceny.
Jak zawsze, zaktualizowany ranking i metodologię znajdziesz na naszej stronie.
-
Nowości dotyczące produktówZapewnienie bezpiecznego korzystania z internetu i ochrona użytkowników przed szkodliwymi treściami to dla nas w Google Play priorytet.
Paul Feng • 2 minuty czytania -
Nowości dotyczące produktówDziś oficjalnie obchodzimy 5. rocznicę wydania Jetpack Compose 1.0. Od wersji 1.0, ogłoszonej 28 lipca 2021 r., do najnowszej wersji 1.11 interfejsy API znacznie się rozwinęły, dlatego chcemy to uczcić.
Rebecca Franks, Nick Butcher, Loryn Hairston • 5 minut czytania -
Nowości dotyczące produktówAndroid Studio Quail 2 jest już stabilny i gotowy do użycia w środowisku produkcyjnym. Wprowadza on zmiany w IDE dzięki współbieżnym przepływom pracy agentów, natywnie zintegrowanemu profilowaniu wycieków pamięci i usuwaniu awarii z uwzględnieniem kontekstu.
Amman Asfaw • 3 minuty czytania
Otrzymuj co tydzień najnowsze informacje o tworzeniu aplikacji na Androida na swoją skrzynkę odbiorczą.