התפתחות באופן המדידה של מודלים גדולים של שפה (LLM) ב-Android: העידן הבא של Android Bench
משך הקריאה: 3 דקות
במרץ השקנו את Android Bench – טבלת ההשוואה של מודלים גדולים של שפה (LLM) למשימות פיתוח של Android בעולם האמיתי. המטרה שלנו הייתה לספק שקיפות לגבי יכולות המודל בפיתוח ל-Android ולעודד שיפורים במודל, כדי לתת לכם אפשרויות מבוססות-AI שיעזרו לכם בתהליך העבודה היומיומי. מאז, שיפרנו את ההשוואה על סמך המשוב שלכם, כולל הערכה של מודלים עם משקלים פתוחים והוספה של מאפייני עלות ויעילות לטבלת ההשוואה.
אבל היכולות של ה-AI משתנות כל הזמן, ולכן גם המדידה צריכה להשתנות בהתאם. במסגרת הגרסה שפרסמנו ביולי, אימצנו את מסגרת Harbor, שכוללת גרסה מעודכנת של סוכן ההשוואה לשוק שמשמש להערכת מודלים.
בנוסף לשינוי הזה בשיטת ההערכה, בגרסת יולי הזו אנחנו מוסיפים לטבלת ההשוואה 8 מודלים חדשים (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus ו-Qwen 3.7 Max). אנחנו גם משתפים הזדמנויות לקהילת מפתחי Android לתרום למדד ההשוואה.
שדרוג המתודולוגיה שלנו באמצעות מסגרת Harbor
כשעיצבנו את Android Bench, ביססנו את המתודולוגיה שלנו על סטנדרטים מובילים בתחום שהיו זמינים באותו זמן. השתמשנו ב-mini-swe-agent v1, סוכן לשימוש כללי להשוואה בין ביצועים, והתאמנו אותו לניואנסים של פיתוח ל-Android כדי לספק מדידת בסיס ליכולות של מודלים במשימות נפוצות של פיתוח ל-Android.
כדי להמשיך לספק לכם הערכות מתקדמות שמודדות בצורה מדויקת את היכולות של המודלים העדכניים בפיתוח ל-Android, אנחנו מתקננים את מדד ההשוואה שלנו ל-Harbor framework. פלטפורמת Harbor מגדירה סטנדרטים ושילובים שמאפשרים לכל אחד להריץ את נקודת ההשוואה, להעריך את ההגדרה המועדפת או לשתף תוצאות – וכך מספקת לכם שקיפות וחשיפה נוספות.
השדרוג הזה מאפשר לנו להעריך את המודלים והיכולות שלהם בצורה מדויקת יותר, והרצנו מחדש את ההשוואה בין המודלים כדי ליצור בסיס מעודכן. המשמעות היא שיהיה שינוי קל בניקוד, אבל עדיין תוכלו לראות את הניקוד ההיסטורי בארכיון באתר שלנו.
אנחנו רוצים לוודא ש-Android Bench מועיל לכם, ולכן נעדכן אותו באופן שוטף ככל שההערכות שלנו והתחום יתפתחו.
הרחבת טבלת ההשוואה עם 8 מודלים חדשים
כחלק מהמחויבות שלנו לשמור על עדכניות טבלת ההשוואה, הוספנו את המודלים Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus ו-Qwen 3.7 Max לטבלת ההשוואה של Android Bench.
אפשר לראות ש-Claude Fable 5 נמצא במקום הראשון בטבלת הדירוג עם ציון של 84.5, אחריו GPT 5.5 עם ציון של 80.2, ו-Claude Sonnet 5 במקום השלישי עם ציון של 76.2.
כשמשווים רק מודלים עם משקלים פתוחים, GLM 5.2 נמצא בראש הרשימה עם 72.2, ואחריו Kimi K2.7 Code עם ציון של 70.4.
כדי לראות איך המודלים החדשים והקודמים מתמודדים עם אתגרים ספציפיים ל-Android, כמו העברות של Jetpack Compose, רשתות של מכשירים לבישים ועדכוני API של הפלטפורמה, אתם יכולים לעיין במדדים של ביצועי המודלים והיעילות שלהם בטבלת ההשוואה המעודכנת.
פתיחת Android Bench לתרומות מהקהילה
מההתחלה, הקפדנו על גישה פתוחה ושקופה, ולכן פרסמנו את המתודולוגיה המקורית ואת מערכת הבדיקה שלנו ב-GitHub. קיבלנו בקשות לספק דרך לשלוח משוב על מערך הנתונים שלנו, ועכשיו אנחנו עושים צעד נוסף בשיתוף הפעולה ומאפשרים לכם, קהילת מפתחי Android, לעצב את Android Bench.
החל מהיום, יש שתי דרכים לתרום ל-Android Bench:
- אתם יכולים לעצב ולשלוח משימות פיתוח משלכם ל-Android כדי להעריך איך המודלים מתמודדים עם התרחישים שחשובים לכם.
- הפעלת השוואות ביצועים ושיתוף שלהן באופן ישיר, בדיקת המודלים המועדפים שלכם מול מערך הנתונים שלנו או מול משימות מותאמות אישית משלכם.
אנחנו נבדוק את המשימות שנשלחו ונחליט אם להוסיף אותן למדד ההשוואה. אנחנו מקווים ליצור מדד השוואה שישקף באמת את המציאות המגוונת של קהילת מפתחי Android העולמית.
מה צפוי בהמשך
ככל שיש יותר ויותר אפשרויות לפיתוח מבוסס-סוכנים, שמירה על מדד מתקדם מבטיחה שהעזרה מבוססת-ה-AI שאתם מסתמכים עליה תהיה חכמה יותר, מועילה יותר ויעילה יותר. אפשר לעבור אל המאגר שלנו ב-GitHub כדי לראות את המשימות. אתם מוזמנים לשלוח משימה לצוות שלנו לבדיקה, ולעיין בHarbor Hub כדי לבדוק את מערך הנתונים או לשלוח הערכות.
כמו תמיד, אפשר לעיין בטבלת המובילים המעודכנת או לקרוא על המתודולוגיה באתר שלנו.
-
חדשות על מוצריםהיום אנחנו משיקים את קבוצת המשימות הראשונה לטווח ארוך (LHT), שהן משימות מורכבות מאוד שמהנדס צריך להקדיש להן כמה ימים או אפילו שבוע כדי להשלים אותן. בנוסף, אנחנו משיקים הערכה באמצעות סוכן, ומתחילים עם סוכנים מספקי מודלים תואמים.
Matthew McCullough • משך הקריאה: 3 דקות -
חדשות על מוצריםהיום אנחנו שמחים להודיע על השקת הגרסה היציבה של ספריות AndroidX Security State גרסה 1.1.0 ו-Security State Provider גרסה 1.0.0.
Maunik Shah, Alec Garcia, Joseph Yong • משך הקריאה: 4 דקות -
חדשות על מוצריםניפוי באגים אלחוטי ב-Android עכשיו מהיר יותר, אמין יותר וקל יותר להגדרה מאי פעם. ב-ADB Wi-Fi 2.0, הוספנו מחסנית שרתים חדשה וטיפול חכם יותר ברשת, כדי לתת מענה ישיר למשוב של מפתחים לגבי פערים בשימושיות.
Steven Jenkins, Sherif Eid, Fabien Sanglard • משך הקריאה: דקה אחת
רוצים לקבל טיפים עדכניים לפיתוח Android ישירות לאימייל כל שבוע?