Inference
Cụm GPU phân tán cho suy luận LLM
Buổi biểu diễn
So sánh
Chi tiết
Nội dung này do RD AI tạo ra, chỉ mang tính tham khảo
Inference là cụm GPU phân tán cho suy luận LLM được xây dựng trên Solana. Inference.net là mạng lưới toàn cầu của các trung tâm dữ liệu phục vụ API trả tiền theo mã thông báo, có khả năng mở rộng và nhanh cho các mô hình như DeepSeek V3 và Llama 3.3.
Gây quỹ
Theo dõi cập nhật
Theo dõi danh sách
Nhân vật
Về Inference
Inference.net vận hành một cụm GPU phân tán chuyên dụng cho suy luận LLM, cung cấp tài nguyên tính toán theo nhu cầu mà không cần hợp đồng dài hạn. Hoạt động kinh doanh cốt lõi của nó là cung cấp các chế độ suy luận đồng bộ, theo lô và bất đồng bộ, với chế độ sau được định giá khoảng 10% so với giá đồng bộ nhờ khai thác dung lượng GPU nhàn rỗi. Nền tảng này cũng bao gồm Catalyst, một bộ công cụ quan sát, đánh giá và tinh chỉnh, đi kèm với công cụ CLI để tự động hóa quy trình làm việc. Lợi thế cạnh tranh của nó nằm ở việc giảm chi phí thông qua sử dụng dung lượng nhàn rỗi và quy trình làm việc thống nhất kết hợp theo dõi, đánh giá và tinh chỉnh mô hình. Câu chuyện trọng tâm là làm cho suy luận LLM trở nên hợp lý và hiệu quả nhất có thể, đặc biệt đối với các khối lượng công việc lớn hoặc có độ trễ chịu đựng được. Vấn đề đau đớn của thị trường rất rõ ràng: chi phí GPU vẫn còn cao, tỷ lệ sử dụng trong ngành chỉ trung bình 15-40%, và các công cụ hiện tại bị phân mảnh giữa các nhà cung cấp khác nhau. Trong sáu tháng qua (2026-03-01 đến 2026-09-01), Inference.net đã ra mắt nền tảng Catalyst vào tháng 3, giới thiệu CLI vào tháng 4, triển khai các yêu cầu bất đồng bộ vào tháng 5, thêm khả năng tinh chỉnh vào tháng 7, và mã nguồn mở một số thành phần vào tháng 8. Một điểm tiêu cực đáng chú ý: vào năm 2025, một số người dùng báo cáo biến động nguồn cung GPU gây ra tăng đột biến độ trễ suy luận, mặc dù điều này không phổ biến.
Inference, thành lập năm 2023, trụ sở tại San Francisco, tập trung xây dựng hạ tầng GPU phân tán cho suy luận LLM và huấn luyện mô hình tùy chỉnh. Vào tháng 10/2025, công ty đã hoàn tất vòng gọi vốn hạt giống trị giá 11,8 triệu USD do Multicoin Capital và a16z CSX dẫn đầu, với sự tham gia của Topology Ventures, Founders, Inc. và một số nhà đầu tư thiên thần. Khoản tài trợ này hỗ trợ sứ mệnh giúp các công ty AI-native giảm sự phụ thuộc vào các phòng thí nghiệm tiên phong bằng cách triển khai các mô hình nhỏ hơn, chuyên biệt theo tác vụ, đạt hiệu suất tương đương với chi phí và độ trễ thấp hơn đáng kể. Nền tảng của Inference cho phép quản lý vòng đời mô hình từ đầu đến cuối—huấn luyện, triển khai, giám sát và đánh giá—với tuyên bố giảm chi phí tới 90% và suy luận nhanh hơn 2-3 lần so với các API đa dụng. Công ty nhắm đến khối lượng công việc sản xuất, cung cấp hạ tầng chạy trên môi trường do khách hàng kiểm soát để đảm bảo quyền riêng tư dữ liệu. Vòng hạt giống này đánh dấu cột mốc quan trọng trong việc xác nhận thị trường cho hạ tầng suy luận chuyên biệt, định vị Inference để cạnh tranh trong lớp hạ tầng AI đang phát triển nhanh chóng.
Inference (inference.net) đã đạt được những bước tiến đáng kể trong sáu tháng qua (2026-03-01 đến 2026-09-01), được thể hiện qua các thông báo chính thức và ra mắt sản phẩm. Những phát triển chính bao gồm việc giới thiệu AutoEvals, một công cụ tự động đánh giá và so sánh hiệu suất LLM bằng cách sử dụng lưu lượng truy cập sản xuất, cho phép lựa chọn mô hình dựa trên dữ liệu. Nền tảng cũng phát hành Schematron V2, một họ mô hình chuyên dụng để trích xuất HTML sang JSON, mang lại độ chính xác và thông lượng được cải thiện (4,14 yêu cầu/giây trên một H100) so với các phiên bản trước. Đáng chú ý, một nghiên cứu điển hình khách hàng với Gravity Ads đã chứng minh chi phí suy luận giảm 10 lần và độ trễ p99 được cải thiện 5,7 lần bằng cách tinh chỉnh mô hình 1B trên dữ liệu sản xuất, thay thế mô hình 70B đa năng. Nhìn về phía trước, lộ trình chính thức của Inference nhấn mạnh việc đào sâu vòng lặp cải tiến liên tục: mở rộng sử dụng dữ liệu sản xuất cho đào tạo và đánh giá tự động, nâng cao nền tảng Catalyst để quản lý vòng đời mô hình từ đầu đến cuối, và phát triển Schematron Pro để có chất lượng trích xuất cao hơn với thông lượng được duy trì. Công ty cũng tập trung vào việc làm cho các vòng lặp đào tạo hiệu quả hơn về chi phí và dễ tiếp cận hơn, với kế hoạch tiếp tục thu hẹp khoảng cách giữa lưu lượng truy cập trực tiếp và cải thiện mô hình.
Sam Heutmaker (Người sáng lập & CEO): Trước đây đã thành lập nhiều công ty khởi nghiệp, bao gồm Leap (CTO, mở rộng lên 120 nghìn người dùng) và Ultramail (Đồng sáng lập, mở rộng lên 100 nghìn người dùng). Đã từng làm Kỹ sư phần mềm cao cấp tại Crowe. Có nền tảng về xây dựng các sản phẩm AI-native và hệ thống phân tán. Ibrahim Ahmed (Đồng sáng lập & CTO): Trước đây tại Founders, Inc. với vai trò Kỹ sư sáng lập và Người sáng lập Studio. Trưởng nhóm kỹ thuật có kinh nghiệm ươm tạo các startup AI. Chuyên gia về huấn luyện mô hình và các mô hình ngôn ngữ chuyên biệt.