Voice AI: Tại sao công nghệ này vẫn chưa có ‘khoảnh khắc ChatGPT’ của riêng mình?
Dù nhận được hàng tỷ USD đầu tư, các chuyên gia cho rằng công nghệ Voice AI hiện nay vẫn còn nhiều rào cản về tốc độ suy luận và độ chính xác trước khi thực sự tạo ra cú hích lớn như...
- Giọng nữ Bắc
Lý thuyết về việc giọng nói sẽ trở thành giao diện tương tác chủ đạo tiếp theo đang thu hút sự chú ý lớn. Các nhà đầu tư đã rót hàng tỷ USD vào các startup Voice AI, từ những đơn vị phát triển mô hình nền tảng, dịch vụ khách hàng doanh nghiệp cho đến các công cụ ghi chú cuộc họp và chuyển đổi giọng nói thành văn bản.
Mỗi tuần, thị trường lại đón nhận những công cụ mới với lời khẳng định có khả năng giao tiếp tự nhiên như người thật. Tuy nhiên, thực tế có thể không hoàn toàn như vậy. Shawn Wen, CTO của nền tảng Voice AI doanh nghiệp PolyAI, cho rằng dù đã đạt được cột mốc mô hình full-duplex (có thể vừa nghe vừa nói), Voice AI vẫn chưa thực sự có một “khoảnh khắc ChatGPT” – thời điểm công nghệ này tạo ra bước ngoặt thay đổi hoàn toàn cách người dùng tương tác.
Thách thức về tốc độ và sự tin tưởng
Theo ông Wen, thách thức tiếp theo không chỉ nằm ở khả năng đối thoại mà là tốc độ suy luận (reasoning). Để cuộc hội thoại trở nên tự nhiên, mô hình cần truy xuất câu trả lời cực nhanh. Ông nhấn mạnh rằng trong dịch vụ khách hàng, các AI agent không nên tạo cảm giác máy móc. Khi AI giải quyết được vấn đề một cách hiệu quả, người dùng sẽ dần tin tưởng và ưu tiên tương tác với máy thay vì con người.
Đồng quan điểm, Alex Gay, CMO của Otter, cho rằng việc nhận diện người nói, nắm bắt ý định và kết nối với tri thức tổ chức là những bước then chốt để tự động hóa. Otter hiện đang phát triển các “digital twin” (bản sao kỹ thuật số) để đại diện cho con người trong các cuộc họp. Ông nhấn mạnh: “Nếu bạn không thể tạo ra sự kết nối, tranh luận hay thảo luận chiến lược với một avatar, thì nó cũng chỉ là một chatbot hỏi-đáp thông thường”.
Rào cản về độ chính xác và tính minh bạch
Dù đã có nhiều cải tiến, các trợ lý AI vẫn thường xuyên gặp lỗi trong việc hiểu người dùng hoặc tạo ra các bản ghi chép cuộc họp sai lệch. Ông Wen chỉ ra rằng các mô hình ASR (Automatic Speech Recognition) thường bỏ lỡ các từ khóa quan trọng, làm mất đi ngữ cảnh của cuộc trò chuyện.
Ông Gay từ Otter thừa nhận rằng độ chính xác của bản ghi là nền tảng của mọi thứ. Nếu bản ghi ban đầu sai sót, mọi hành động tiếp theo (như tóm tắt hay thực hiện tác vụ) đều sẽ bị lỗi, dẫn đến việc người dùng mất niềm tin vào nền tảng. Do đó, việc liên tục cải thiện mô hình ASR là ưu tiên sống còn.
Cuối cùng, vấn đề minh bạch cũng được đặt lên hàng đầu. Cả PolyAI và Otter đều đồng thuận rằng các công cụ AI cần thông báo rõ ràng cho người dùng khi họ đang tương tác với máy hoặc khi cuộc hội thoại đang được ghi âm. Đây là yếu tố cốt lõi để xây dựng niềm tin bền vững trong kỷ nguyên AI hiện nay.
Nguồn tham khảo: TechCrunch
No Comment! Be the first one.