Jaya Gupta, đối tác tại Foundation Capital. Ảnh: LinkedIn của Jaya Gupta

Hệ sinh thái mô hình ngôn ngữ lớn (LLM) đang bước vào giai đoạn tách chức năng, khi những tác vụ trước đây được dồn vào một mô hình duy nhất bắt đầu được phân rã thành các lớp chuyên biệt hơn. Theo Jaya Gupta, đối tác tại Foundation Capital, xu hướng này sẽ tác động trực tiếp đến cấu trúc chi phí, cách xây dựng sản phẩm và mô hình doanh thu của các công ty AI.

Trong bài đăng gần đây trên mạng xã hội X, Gupta gọi xu hướng này là “Great Unbundling of Intelligence” và xem đây là một chuyển động đáng chú ý của thị trường AI trong thời gian tới.

Ông cho biết trong ba năm qua, một LLM thường được dùng để xử lý hàng loạt nhiệm vụ, từ trích xuất tài liệu, tìm kiếm, xếp hạng, phát hiện bất thường, chọn công cụ, duyệt web, soạn câu trả lời, kiểm chứng cho tới các bài toán suy luận phức tạp. Tuy nhiên, cách “gom mọi thứ vào một mô hình” đang dần nhường chỗ cho kiến trúc tách rời từng chức năng.

Theo Gupta, mỗi năng lực đòi hỏi mức tài nguyên tính toán khác nhau, trong khi điểm mạnh giữa các mô hình cũng không đồng đều. Khi khoảng cách về hiệu năng, độ trễ và chi phí ngày càng rõ hơn, cấu trúc tối ưu về mặt kinh tế cũng thay đổi theo, qua đó thúc đẩy quá trình tách chức năng trong hệ thống AI.

Gupta đặc biệt nhấn mạnh vai trò của agent. Theo ông, agent thường biến một mục tiêu do con người đưa ra thành hàng trăm, thậm chí hàng nghìn quyết định nhỏ mang tính cơ học. Ở quy mô đó, chênh lệch rất nhỏ về chi phí hay độ trễ ở từng bước có thể cộng dồn thành yếu tố quyết định hiệu quả kinh tế của cả sản phẩm.

Ông cho rằng suy luận hiện đã trở thành một khoản chi phí vận hành cốt lõi. Trong khi đó, các mô hình nhỏ hơn và các mô hình có trọng số mở đã đủ tốt để xử lý nhiều tác vụ thường nhật. Những năng lực như tìm kiếm, bộ nhớ hay điều khiển máy tính cũng đang dần được tách khỏi LLM để cung cấp dưới dạng dịch vụ riêng. Cùng với đó, các hệ thống đánh giá tốt hơn giúp doanh nghiệp xác định liệu một giải pháp rẻ hơn đã đủ đáp ứng yêu cầu hay chưa.

Theo Gupta, khi các mô hình frontier ngày càng mạnh hơn, việc tách chức năng thậm chí có thể trở thành lựa chọn an toàn hơn từ góc nhìn người dùng.

Ông nhận định những bài toán khó mà mô hình giá rẻ không xử lý được có thể được chuyển lên lớp mô hình frontier ở tầng trên cùng. Khi đó, cách tiếp cận sẽ chuyển từ “dùng mô hình frontier ngay từ đầu rồi tối ưu chi phí về sau” sang “mặc định dùng mô hình rẻ trước, chỉ chuyển tác vụ lên mô hình frontier khi thực sự bế tắc”.

Gupta cũng dẫn ví dụ về Jev, sản phẩm do TypeSafe phát triển. Theo ông, Jev có thể được xem là một mô hình tách riêng chức năng ra quyết định. Khi được cung cấp một tình huống phức tạp, một câu hỏi hẹp và danh sách phương án trả lời, Jev sẽ đưa ra quyết định kèm xác suất, thay vì tạo ra một đoạn văn bản hoàn chỉnh.

Ông cho rằng phần mềm thực tế cần nhiều quyết định ở dạng nhị phân hoặc mệnh lệnh rõ ràng như “có khẩn cấp hay không”, “tiếp tục hay dừng”, “cho phép hay chặn”. Trong khi đó, mô hình ngôn ngữ hiện nay thường tạo câu chữ trước rồi mới chuyển ngược thành quyết định. Với nhiều tác vụ lặp lại bên trong agent, quy trình này là không cần thiết.

Ở góc độ doanh thu của các nhà cung cấp LLM, Gupta nói đây là vấn đề khó né tránh. Anthropic có thể duy trì mức giá cao ngay cả với những tác vụ đơn giản để tạo biên lợi nhuận lớn. Nhưng khi ngày càng có nhiều bên đảm nhận phần việc dễ với chi phí thấp hơn, biên lợi nhuận đó sẽ chịu áp lực bào mòn.

Ông lấy ví dụ việc đánh giá mức độ khẩn cấp có thể được xử lý bởi các mô hình chuyên ra quyết định như Jev với chi phí dưới 1 cent. Tác vụ xếp hạng cũng có thể do các reranker đảm nhiệm. Nếu phần tìm kiếm do các công ty tìm kiếm cung cấp, còn việc soạn nội dung phổ thông do mô hình giá rẻ xử lý, các ứng dụng AI sẽ không cần đối đầu trực diện với Anthropic ở mọi khâu.

Theo Gupta, bức tranh này có thể được tóm lược bằng hiện tượng “nghịch lựa chọn” đối với suy luận frontier. Càng tối ưu định tuyến tốt, khối lượng công việc lớn, rẻ và dễ dự báo càng rời khỏi lớp mô hình frontier; phần còn lại chủ yếu là các vấn đề mơ hồ hơn, khó hơn và đòi hỏi quá trình xử lý dài hơn.

Ông dự báo khi chi phí cho một quyết định giảm xuống dưới 1 cent và thời gian xử lý rút còn vài trăm mili giây, nhiều sản phẩm mới sẽ trở nên khả thi.

Gupta cho rằng doanh nghiệp có thể gắn thêm các mô hình chuyên ra quyết định để kiểm tra kết quả sau mỗi lần AI agent thực hiện hành động. Những kịch bản cần phản hồi nhanh như điều khiển trình duyệt web hoặc hội thoại giọng nói cũng có thể tích hợp lớp chức năng này.

Ông nhấn mạnh các lĩnh vực như tư vấn, tìm kiếm, giao dịch, yêu cầu bồi thường bảo hiểm hay điều khoản hợp đồng đều có thể được đánh giá toàn bộ thay vì chỉ kiểm tra mẫu ở tỷ lệ 1%. Điều đó mở ra khả năng giám sát và quản trị chất lượng theo thời gian thực.

Gupta kết luận rằng trong vài năm qua, ngành AI chủ yếu đặt câu hỏi có thể nhồi thêm bao nhiêu chức năng vào một mô hình duy nhất. Nhưng trong thập kỷ tới, trọng tâm có thể đảo ngược: tách từng chức năng ra riêng, rồi tái kết hợp chúng theo nhu cầu ở tầng ứng dụng.

Từ khóa

#trí tuệ nhân tạo #LLM #agent #Foundation Capital #Anthropic #TypeSafe #Jev #chi phí suy luận #mô hình frontier
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.