Trong ngành công nghiệp Trí tuệ Nhân tạo (AI), người dùng ngày càng nhận thức rõ chi phí triển khai có thể tốn kém ra sao và mong muốn cắt giảm chi phí này. Mặc dù các mô hình mã nguồn mở cung cấp chi phí trên mỗi token thấp hơn đáng kể, nhưng việc tìm ra mô hình phù hợp cho từng công việc có thể gặp khó khăn.
Vào thứ Năm vừa qua, Writer, một công ty cung cấp công cụ và tác nhân AI cho các chuyên gia tiếp thị, đã ra mắt mô hình chủ lực mới có tên là Palmyra X6, nhằm giải quyết vấn đề này cho người dùng. Được xây dựng dựa trên biến thể sau đào tạo của mô hình mã nguồn mở GLM-5.2 của Z.ai, Writer cho biết hệ thống mới này sẽ cung cấp các khả năng sẵn sàng triển khai với mức giá thấp hơn nhiều. Công ty ước tính mô hình mới, kết hợp với những thay đổi trong cơ sở hạ tầng harness của công ty, sẽ giúp cắt giảm chi phí cho khách hàng tới 50% cho các tác vụ cơ bản.
Cùng với mô hình mới, công ty cũng công bố các nâng cấp đáng kể cho hệ thống harness tác nhân tiêu chuẩn của mình. Cả hai tính năng này sẽ có sẵn cho khách hàng của Writer kể từ thứ Năm.
Bà May Habib, Giám đốc điều hành của Writer, cho biết: “Tôi nghĩ rằng các doanh nghiệp đã hoàn toàn mệt mỏi với việc chạy theo các chỉ số hiệu suất mới nhất. Họ muốn chi phí ổn định, và dường như không ai có thể mang lại điều đó.”
Cách tiếp cận mới này đặc biệt nhấn mạnh vào các tác vụ phức tạp, nhiều bước, được thực hiện nhanh hơn và với ít token hơn. Writer xem việc tối ưu hóa harness là một đòn bẩy quan trọng để đạt được điều đó.
Một bài báo gần đây của các nhà nghiên cứu Writer ủng hộ phương pháp này, thử nghiệm những thay đổi nhỏ về hiệu quả harness trên nhiều mô hình khác nhau. Nghiên cứu cho thấy trong nhiều trường hợp, những thay đổi trong harness là một cách đáng tin cậy hơn để giảm chi phí so với việc lựa chọn mô hình, với chi phí giảm trung bình 40% trong các thử nghiệm của họ.
“Harness là thành phần duy nhất có hiệu quả nhân lên trên mọi mô hình mà một tổ chức chạy—hiện tại và trong tương lai,” các nhà nghiên cứu viết.
Đối với các khách hàng của Writer, trải nghiệm vẫn không phụ thuộc vào mô hình: Palmyra X6 sẽ hoạt động song song với các mô hình Writer khác hoặc các mô hình bên ngoài được nhập thông qua Azure hoặc Amazon Bedrock. Tuy nhiên, bà Habib cũng cho rằng việc đẩy mạnh cắt giảm chi phí đang thúc đẩy sự ngờ vực rộng rãi đối với các phòng thí nghiệm AI lớn, những người có động lực tài chính để tăng việc sử dụng token.
Bà Habib nói thêm: “Sự bùng nổ chi phí ở đây là chưa từng có đối với khách hàng, và mức độ mà các CIO từ bỏ các phòng thí nghiệm cũng vậy. Họ [các phòng thí nghiệm AI] không thực sự hiểu sâu về cách giúp doanh nghiệp hưởng lợi từ AI.”
Thông tin này được cung cấp bởi TechCrunch.



