Ảnh: Shutterstock

PolyAI ngày 30/7 (giờ địa phương) công bố Dialog-RSN-1, mô hình AI hội thoại giọng nói thời gian thực có thể xử lý và phản hồi trực tiếp trên tín hiệu âm thanh. Theo SiliconAngle, sản phẩm được phát triển nhằm rút ngắn độ trễ trong các cuộc gọi và mang lại trải nghiệm hội thoại tự nhiên hơn.

Phần lớn hệ thống AI giọng nói hiện nay thường phải qua nhiều công đoạn, từ nhận dạng giọng nói, chuyển thành văn bản, xử lý nội dung rồi mới tổng hợp thành giọng nói. Với Dialog-RSN-1, PolyAI tích hợp khâu nhận dạng và xử lý giọng nói ngay trong mô hình, trong khi phần phát giọng nói được tách thành một mô-đun riêng.

Theo công ty, cách tiếp cận này giúp hệ thống nắm bắt tốt hơn ngữ điệu, nhịp nói và ngữ cảnh hội thoại — những yếu tố dễ bị suy giảm khi giọng nói phải chuyển qua bước phiên âm thành văn bản.

Dialog-RSN-1 diễn giải trực tiếp tín hiệu âm thanh gốc thay vì dựa vào bản chép lời. PolyAI cho biết nhờ đó, mô hình có thể xử lý tốt hơn những từ được phát âm không rõ ràng hoặc các cách diễn đạt cần phân biệt bằng ngữ cảnh. Ví dụ, hệ thống có thể hiểu cách đánh vần như “Matthew có hai chữ T”, hoặc phân biệt những tên thương hiệu dễ bị nhầm với từ thông dụng như “Audibel” dựa trên ngữ cảnh cuộc hội thoại.

Tốc độ phản hồi cũng là điểm PolyAI đặc biệt nhấn mạnh. Theo công bố của công ty, Dialog-RSN-1 vận hành với độ trễ 280-500 mili giây và có thể đưa ra phản hồi trong chưa đầy 300 mili giây trong một số trường hợp. Để so sánh, OpenAI GPT Realtime 2.1 có độ trễ 860-1.900 mili giây.

Từ khóa

#PolyAI #trí tuệ nhân tạo #Dialog-RSN-1 #mô hình hội thoại giọng nói #hội thoại thời gian thực #độ trễ phản hồi
Copyright © DigitalToday. All rights reserved. Unauthorized reproduction and redistribution are prohibited.