Meta Llama. Ảnh: Shutterstock

Meta ngày 5/8 công bố bản beta Muse Code, một agent lập trình AI hoạt động trên terminal, chính thức tham gia cuộc đua tự động hóa phát triển phần mềm bằng trí tuệ nhân tạo. Thay vì nhấn vào vị trí dẫn đầu trên các bảng benchmark, công ty cho biết sản phẩm này được thiết kế để chạy tự trị trong thời gian dài và có thể phục hồi sau sự cố.

Theo Decrypt, Muse Code được xây dựng trên Muse Spark 1.2, mô hình lập trình mới nhất của Meta.

Công cụ hiện có thể sử dụng thông qua Meta Model API và script cài đặt. Theo Meta, Muse Code được thiết kế để xử lý trọn quy trình phát triển phần mềm, từ lập kế hoạch thay đổi trên các kho mã lớn, viết mã cho tới kiểm tra kết quả. Công ty cho biết đã mở bản beta và đang chuẩn bị các mô hình lớn hơn, mạnh hơn trong thời gian tới.

Điểm Meta đặc biệt nhấn mạnh nằm ở kiến trúc vận hành. Muse Code ghi lại toàn bộ lịch sử gọi mô hình, thao tác với công cụ, phê duyệt của người dùng và chỉnh sửa mã vào nhật ký sự kiện cục bộ. Dựa trên nhật ký này, hệ thống có thể khôi phục trạng thái công việc và tiếp tục từ đúng điểm dừng nếu phiên chạy bị gián đoạn hoặc gặp sự cố.

Muse Code cũng được bổ sung các tính năng phục vụ những tác vụ kéo dài. Công cụ hỗ trợ sẵn các lệnh như “/plan” để lập kế hoạch, “/grill” để rà soát lặp lại kế hoạch và “/goal” để tiếp tục làm việc cho tới khi hoàn tất mục tiêu. Meta cho biết Muse Spark 1.2 đã được huấn luyện giúp mô hình ngôn ngữ lớn và agent phối hợp chặt chẽ hơn.

Về benchmark, Muse Spark 1.2 hiện chưa thuộc nhóm dẫn đầu. Tài liệu Meta công bố cho thấy mô hình này có điểm thấp hơn Anthropic Opus 5 ở tất cả các benchmark lập trình chính. Dù vậy, Muse Spark 1.2 vẫn nhỉnh hơn OpenAI Codex và Google Antigravity ở phần lớn hạng mục.

Trong bài kiểm tra Terminal Bench 2.1, đánh giá năng lực lập trình trên terminal, Muse Code đạt 82,9%. Trong khi đó, Claude Code dựa trên Opus 5 đạt 86,7%, Codex đạt 81,8% và Grok Build đạt 81,6%.

Ở benchmark DeepSWE 1.1, thước đo năng lực phát triển phần mềm của AI agent, Muse đạt 59,3%, thấp hơn Opus 5 với 65,0% và Codex với 64,8%. Trong benchmark lập trình nội bộ của Meta, Muse đạt 70,6%, so với 79,4% của Opus 5.

Meta cho rằng lợi thế của Muse nằm ở độ ổn định trong các phiên chạy kéo dài. Theo công ty, trong môi trường vận hành dài với hơn 1.000 lần gọi công cụ, hiệu năng của Muse Spark 1.2 tăng lên khoảng 61-69%, tùy điều kiện chạy. Ở một bản trình diễn thực tế, hệ thống chạy trên GPU Nvidia Hopper trong 24 giờ và thực hiện hơn 1.000 lần gọi công cụ để tối ưu lặp lại GPU kernel.

Trong một bản demo khác, khi người dùng nhập video quay bằng drone bên trong một ngôi nhà, hệ thống phân tích nội dung và tự động tạo website có tích hợp tính năng đặt lịch. Meta cho biết công cụ có thể diễn giải video và dựng một website đặt lịch thiên về yếu tố hình ảnh.

Tuy nhiên, xét về thời điểm gia nhập thị trường, Meta vẫn đi sau một số đối thủ. OpenAI đã cung cấp agent lập trình Codex chạy song song trên nền tảng đám mây, trong khi DeepSeek cũng giới thiệu sản phẩm cạnh tranh với Claude Code. Các công cụ lập trình AI mã nguồn mở như Hermes và OpenClaw cũng đang lan rộng nhanh chóng. Trong bối cảnh đó, Meta chọn hướng khác biệt hóa bằng khả năng phục hồi sau sự cố, vận hành tự trị trong thời gian dài và cách điều phối các agent con, thay vì chỉ tập trung vào hiệu năng thuần túy.

Dù vậy, thách thức còn lại là các AI agent tự vận hành trong thời gian dài tuy có thể giúp tăng năng suất, nhưng đồng thời cũng làm giảm mức độ dự đoán của quá trình làm việc.

Meta cho biết hãng xem kiến trúc này là hướng đi cần thiết cho môi trường phát triển phần mềm trong tương lai và vì vậy đã mở bản beta trước. Nhà phát triển hiện có thể tự trải nghiệm Muse Code thông qua lệnh cài đặt.

Từ khóa

#Meta #Muse Code #Muse Spark 1.2 #AI agent lập trình #Codex #Claude Code #Opus 5 #Terminal Bench 2.1 #DeepSWE 1.1 #Grok Build
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.