Fish Audio, một công ty khởi nghiệp có trụ sở tại Palo Alto, vừa thông báo đã huy động thành công 50 triệu đô la Mỹ trong một vòng gây quỹ hạt giống do Coreline Ventures và Capital Today dẫn đầu. Khoản đầu tư này sẽ thúc đẩy nỗ lực của công ty trong việc xây dựng các mô hình giọng nói trí tuệ nhân tạo tiên tiến, phục vụ cả những người sáng tạo nội dung lẫn các doanh nghiệp.
Kể từ khi ra mắt vào năm ngoái, Fish Audio đã thu hút hơn 8 triệu người dùng với các mô hình mã nguồn mở và phiên bản lưu trữ. Công ty hiện đang tạo ra doanh thu định kỳ hàng năm (ARR) là 21 triệu đô la Mỹ. Các mô hình của Fish Audio cung cấp hơn 15.000 tùy chọn điều khiển ngôn ngữ tự nhiên, cho phép tạo ra giọng nói đa dạng, từ biểu cảm cho mục đích sáng tạo đến khả năng điều hướng cao cho tự động hóa hỗ trợ khách hàng và vận hành bán hàng.
Fish Audio bắt nguồn từ một dự án cá nhân của Shijia Liao, cựu nhà nghiên cứu tại NVIDIA. Anh đã phát triển một mô hình tạo giọng nói trên một card đồ họa duy nhất, sau đó mã nguồn mở. Kho lưu trữ Fish Speech trên GitHub hiện có hơn 31.000 sao, được sử dụng rộng rãi bởi các nhà phát triển độc lập, nhà thiết kế trò chơi và người sáng tạo nội dung.
Công ty đã ra mắt năm mô hình trong năm qua, bao gồm bốn mô hình chuyển giọng nói thành văn bản và một mô hình chuyển văn bản thành giọng nói. Mặc dù ba mô hình chuyển giọng nói thành văn bản được cung cấp dưới dạng mã nguồn mở, nhưng mô hình S2.1 Pro mới nhất chỉ có sẵn thông qua API trả phí. Fish Audio cung cấp các gói đăng ký hàng tháng cho người sáng tạo, bao gồm số phút tạo giọng nói nhất định và tính năng sao chép giọng nói. Họ cũng cung cấp giải pháp doanh nghiệp thông qua API và nền tảng, được sử dụng bởi các tổ chức như HeyGen, Sanas và Plaud.
Tuy nhiên, Fish Audio đã phải đối mặt với những lo ngại về đạo đức liên quan đến việc sử dụng giọng nói của người sáng tạo. Trước đây, đã có những cáo buộc rằng giọng nói của một số người sáng tạo đã được sử dụng để đào tạo mô hình mà không có sự đồng ý của họ. Để giải quyết vấn đề này, công ty đã tự động hóa quy trình gỡ bỏ nội dung theo DMCA, cho phép người sáng tạo dễ dàng yêu cầu gỡ bỏ giọng nói của họ trong vòng chưa đầy 3 phút bằng cách cung cấp bằng chứng quyền sở hữu. Theo TechCrunch, quy trình này đã được cải thiện đáng kể.
Nhìn về phía trước, Fish Audio dự định ra mắt một mô hình hiểu âm thanh trong năm nay và đang phát triển một mô hình chuyển giọng nói sang giọng nói. Thị trường tạo giọng nói bằng AI ngày càng cạnh tranh với sự tham gia của các công ty như ElevenLabs, WellSaid, Cartesia, Speechify, Async và Krisp.



