Tin tức về sản phẩm

Phát triển cách đo lường LLM cho Android: kỷ nguyên tiếp theo của Android Bench

3 phút đọc
Xem hồ sơ của Zoe Lopez-Latorre
Zoe Lopez-Latorre Kỹ sư Quan hệ Nhà phát triển cấp cao, Android

Hồi tháng 3, chúng tôi đã giới thiệu Android Bench—bảng xếp hạng LLM của chúng tôi dành cho các nhiệm vụ phát triển Android thực tế.Mục tiêu của chúng tôi là cung cấp sự minh bạch về khả năng của mô hình trong phát triển Android và khuyến khích cải tiến mô hình, nhằm mang đến cho bạn nhiều lựa chọn AI hữu ích hơn cho quy trình làm việc hàng ngày. Kể từ đó, chúng tôi đã cải tiến tiêu chuẩn dựa trên phản hồi của bạn, bao gồm cả việc đánh giá.mô hình trọng lượng mở và bổ sung thêm các khía cạnh về chi phí và hiệu quả vào bảng xếp hạng.

Nhưng khả năng của trí tuệ nhân tạo không ngừng phát triển, và phương pháp đo lường cũng cần phải theo kịp. Trong bản phát hành tháng 7, chúng tôi đã áp dụng khung Harbor, bao gồm phiên bản cập nhật của tác nhân đánh giá chuẩn được sử dụng để đánh giá các mô hình. 

Cùng với sự thay đổi này trong đánh giá của chúng tôi, trong bản phát hành tháng 7 này, chúng tôi sẽ bổ sung thêm 8 mẫu mới (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus và Qwen 3.7 Max) vào bảng xếp hạng. Chúng tôi cũng chia sẻ những cơ hội để cộng đồng nhà phát triển Android có thể đóng góp vào tiêu chuẩn này. 

Nâng cấp phương pháp luận của chúng tôi với khuôn khổ Harbor

Khi thiết kế Android Bench, chúng tôi đã dựa trên phương pháp luận của các tiêu chuẩn hàng đầu trong ngành hiện có vào thời điểm đó. Chúng tôi đã sử dụng mini-swe-agent v1, một tác nhân đánh giá hiệu năng đa năng, và điều chỉnh nó cho phù hợp với những đặc thù của việc phát triển Android để cung cấp một phép đo cơ bản về khả năng của các mô hình đối với các tác vụ phát triển Android thông thường.

Để tiếp tục cung cấp cho bạn các đánh giá tiên tiến đo lường chính xác các chức năng mới nhất của mô hình trong quá trình phát triển Android, chúng tôi đang chuẩn hoá điểm chuẩn theo khuôn khổ Harbor. Harbor định nghĩa các tiêu chuẩn và tích hợp giúp bất kỳ ai cũng có thể dễ dàng chạy thử nghiệm hiệu năng, đánh giá thiết lập ưa thích của họ hoặc chia sẻ kết quả – mang lại cho bạn sự minh bạch và khả năng theo dõi tốt hơn.

Nhờ bản nâng cấp này, chúng tôi có thể đánh giá các mô hình và khả năng của chúng một cách nghiêm ngặt hơn, đồng thời chạy lại điểm chuẩn trên tất cả các mô hình để thiết lập một đường cơ sở mới. Điều này có nghĩa là điểm số sẽ có một chút thay đổi, nhưng bạn vẫn có thể xem điểm số trước đây trong kho lưu trữ trên trang web của chúng tôi.

Chúng tôi muốn đảm bảo Android Bench hữu ích cho bạn, vì vậy, chúng tôi sẽ liên tục cập nhật công cụ này khi các hoạt động đánh giá của chúng tôi và ngành này phát triển.

Mở rộng bảng xếp hạng với 8 mô hình mới

Để bảng xếp hạng luôn mới mẻ, chúng tôi đã thêm Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus và Qwen 3.7 Max vào bảng xếp hạng Android Bench. 

Bạn sẽ thấy Claude Fable 5 đứng đầu bảng xếp hạng với điểm số 84,5, tiếp theo là GPT 5.5 với 80,2 và Claude Sonnet 5 ở vị trí thứ 3 với điểm số 76,2.

Khi chỉ so sánh các mô hình mã nguồn mở, GLM 5.2 đứng đầu với 72,2, tiếp theo là Kimi K2.7 Code với điểm số 70,4.

Bạn có thể xem các chỉ số về hiệu suất và hiệu quả của mô hình trên bảng xếp hạng mới cập nhật để biết cách các mô hình mới và cũ này giải quyết những thách thức dành riêng cho Android như việc di chuyển Jetpack Compose, kết nối mạng cho thiết bị đeo và các bản cập nhật API nền tảng.  

image1.png

Mở Android Bench cho cộng đồng đóng góp

Ngay từ đầu, chúng tôi đã coi trọng phương pháp tiếp cận minh bạch và cởi mở. Đó là lý do chúng tôi công khai phương pháp và bộ kiểm thử ban đầu trên GitHub. Bạn đã yêu cầu chúng tôi cung cấp một cách để gửi ý kiến phản hồi về tập dữ liệu của chúng tôi. Vì vậy, giờ đây, chúng tôi sẽ tiến thêm một bước trong việc hợp tác bằng cách cho phép bạn (cộng đồng nhà phát triển Android) định hình Android Bench.

Kể từ hôm nay, bạn có thể đóng góp cho Android Bench theo hai cách:

  1. Thiết kế và gửi các nhiệm vụ phát triển Android của riêng bạn để đánh giá cách các mô hình xử lý những tình huống quan trọng đối với bạn.
  2. Chạy và chia sẻ trực tiếp các đánh giá điểm chuẩn, kiểm thử các mô hình bạn muốn dựa trên tập dữ liệu của chúng tôi hoặc các tác vụ tuỳ chỉnh của riêng bạn.

Chúng tôi sẽ xem xét các nhiệm vụ đã gửi và đánh giá xem các nhiệm vụ đó có được thêm vào điểm chuẩn hay không. Chúng tôi hy vọng sẽ xây dựng được một điểm chuẩn thực sự phản ánh những thực tế đa dạng trong cuộc sống hằng ngày của cộng đồng nhà phát triển Android trên toàn cầu.

Nhìn về tương lai

Với ngày càng nhiều lựa chọn để phát triển dựa trên tác nhân, việc duy trì một tiêu chuẩn tiên tiến đảm bảo rằng trợ lý AI mà bạn tin dùng sẽ ngày càng thông minh hơn, hữu ích hơn và hiệu quả hơn. Hãy truy cập kho lưu trữ GitHub của chúng tôi để xem các nhiệm vụ. Bạn có thể gửi một nhiệm vụ cho nhóm chúng tôi xem xét và tham khảo Harbor Hub để khám phá tập dữ liệu hoặc gửi bản đánh giá.

Như thường lệ, bạn có thể xem bảng xếp hạng mới cập nhật hoặc đọc phương pháp trên trang web của chúng tôi. 

Tác giả:
Đọc tiếp