Mô hình Claude của Anthropic. Ảnh: Shutterstock

Claude Opus 5 của Anthropic đang thu hút chú ý sau khi một demo cho thấy mô hình này có thể tạo ra một game bắn súng góc nhìn thứ nhất (FPS) có thể chơi được chỉ từ prompt gồm 3 đoạn ngắn. Vụ việc cũng châm ngòi tranh luận về cách viết prompt trong lập trình bằng AI, cũng như giới hạn của dữ liệu huấn luyện.

Theo Decrypt ngày 28/7 (giờ địa phương), nhà đầu tư AI và cựu CEO Hyperlight, Matt Shumer đã đăng tải một video cho thấy Claude Opus 5, chỉ sau 2 ngày ra mắt, có thể tự tạo game mà không sử dụng bất kỳ asset bên ngoài nào.

Demo do Shumer công bố là một game FPS chạy trên trình duyệt. Ông cho biết Claude Opus 5 đã tạo xong trò chơi này chỉ trong một lượt, và toàn bộ những gì xuất hiện trong bản demo đều được xây dựng bằng mã tùy biến.

Prompt được đăng trên GitHub gồm 3 đoạn ngắn. Nội dung yêu cầu mô hình tạo một game bắn súng ở mức “Call of Duty”, đồng thời chia công việc cho nhiều agent phụ. Sau đó, một agent phản biện sẽ đánh giá từng kết quả bằng cách so sánh mù với video gameplay. Prompt cũng đặt ra yêu cầu rằng đầu ra cuối cùng phải đạt mức hoàn thiện cao.

Theo mô tả, trọng tâm của prompt không nằm ở việc liệt kê một danh sách dài tính năng, mà ở chỗ xác định rõ chuẩn so sánh và thiết lập cơ chế đánh giá lặp lại. Shumer gọi phương pháp này là “gauntlet loop”, tức đưa ra các tiêu chí có thể kiểm chứng thay vì chỉ dẫn mơ hồ, chia nhỏ nhiệm vụ và tách riêng khâu tạo kết quả với khâu tự đánh giá. Ông cho biết mình không chỉ định renderer, cũng không cung cấp sẵn danh sách hệ thống game hay định nghĩa chi tiết thế nào là chất lượng cấp AAA.

Quy trình này tận dụng các tính năng của Claude Code. Các agent phụ làm việc với ngữ cảnh và quyền truy cập công cụ tách biệt. Thiết lập “Ultracode” cho phép mô hình tự lập kế hoạch và phân phối công việc cho tối đa 16 agent. Tính năng “/loop” tích hợp của Anthropic hỗ trợ lặp lại các bước sửa lỗi, kiểm thử và tinh chỉnh. Shumer không đặt giới hạn số vòng lặp; mỗi khi agent phản biện phát hiện thêm vấn đề, hệ thống lại tiếp tục cải thiện.

Phiên bản hoàn chỉnh của game chạy trên Three.js và WebGL2. Tổng quy mô mã nguồn vào khoảng 55.000 dòng, được chia thành 11 hệ thống con. Texture, mesh, animation và âm thanh đều được tạo ra trong lúc trình duyệt tải game, không dùng mô hình tải về hay các tệp hình ảnh, âm thanh có sẵn. Dù vậy, theo log đánh giá do Shumer công bố, điểm số của bản demo chỉ tăng từ 3,59/10 lên trên 5/10; trong mọi vòng được ghi lại, “Call of Duty” vẫn được chấm cao hơn.

Sau đó, nhiều trường hợp thử chạy lại cùng prompt cũng xuất hiện. James Altucher, cựu quản lý quỹ phòng hộ và là podcaster, cho biết ông đã dùng cùng prompt để tạo ra “Operation Blackout”, tiêu tốn hơn 10 giờ và khoảng 1,3 triệu token. Một nhà phát triển thuộc Prompt Silo cũng công bố kết quả khi áp dụng yêu cầu này cho mô hình cao cấp của OpenAI có tên “Sol 5.6 Ultra”. Trong khi đó, nhà phát triển Leon Lin không dùng prompt ngắn của Shumer mà soạn một tài liệu chi tiết gồm khoảng 20 mục, trong đó có cả vật lý ragdoll và shadow map, rồi thử nghiệm trên Cursor. Sản phẩm mang tên “Dust Corridor” của ông cũng chạy trên trình duyệt.

Tuy nhiên, các kết quả xuất hiện sau đó không trải qua bài kiểm tra so sánh mù như cách Shumer thực hiện. Vì vậy, mức độ ổn định của prompt 3 đoạn này khi áp dụng cho mô hình hoặc quy trình khác hiện vẫn chưa được kiểm chứng đầy đủ.

Bên cạnh khía cạnh kỹ thuật, một số ý kiến cũng chỉ ra những giới hạn của kết quả trên. FPS là thể loại đã tích lũy rất nhiều ví dụ từ mã nguồn công khai, tutorial và các diễn đàn lập trình. Bản thân Three.js cũng có sẵn ví dụ về điều khiển camera với cơ chế khóa con trỏ; các mẫu xử lý ngắm bằng chuột, di chuyển WASD hay bắn dựa trên tia cũng đã được chia sẻ rộng rãi từ lâu. Trong bối cảnh đó, khó có thể loại trừ khả năng mô hình sinh mã chỉ đang tái kết hợp các mẫu đã học từ kho dữ liệu công khai.

Các nhà nghiên cứu gọi hiện tượng này là “nhiễm bẩn dữ liệu huấn luyện”, tức những ví dụ gần như tương đồng đã tồn tại sẵn trong dữ liệu huấn luyện, khiến khả năng tái dựng có thể ảnh hưởng đến hiệu năng nhiều hơn suy luận mới. Trong trường hợp demo FPS lần này, quy trình kiểm tra để xác thực vấn đề đó chưa được công bố. Vì thế, kết quả này nên được xem là minh chứng cho hiệu quả của công cụ lập trình theo hướng agent trong một thể loại đã được tài liệu hóa dày đặc, hơn là bằng chứng cho thấy AI có thể tự thiết kế game bắn súng từ con số 0.

Từ khóa

#Anthropic #Claude Opus 5 #prompt #lập trình AI #FPS #Three.js #WebGL2 #GitHub
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.