GPT-5.6 Sol chạy trên chip Cerebras, nhanh 750 token/giây
OpenAI vừa đưa mô hình mới nhất của mình, GPT-5.6 Sol, chạy trên chip Cerebras thay vì hạ tầng quen thuộc của Nvidia, đạt tốc độ tạo văn bản lên tới 750 token mỗi giây. Đây là bước đi đáng chú ý trong một mối quan hệ hợp tác trị giá hơn 10 tỷ USD, và là dấu hiệu rõ ràng cho thấy cuộc đua chip AI không còn là sân chơi một mình Nvidia. Bài viết giải thích GPT-5.6 Sol là gì, chip Cerebras đặc biệt ở đâu, và vì sao OpenAI vẫn chưa thể rời hoàn toàn Nvidia, qua lăng kính các nguồn quốc tế.
GPT-5.6 Sol chạy trên chip Cerebras đạt tốc độ tạo văn bản vượt trội so với hạ tầng GPU thông thường.
OpenAI đã ra mắt mô hình GPT-5.6 Sol vào ngày 10/7/2026 và cho chạy trên chip Cerebras WSE-3, đạt tốc độ tạo văn bản tới 750 token mỗi giây, nhanh hơn nhiều lần so với việc triển khai một mô hình lớn trên GPU Nvidia. Hai bên đã ký hợp đồng nhiều năm từ tháng 1/2026, trị giá hơn 10 tỷ USD, cung cấp tới 750 MW công suất tính toán chuyên cho tác vụ suy luận độ trễ thấp. Chip WSE-3 của Cerebras đặc biệt ở chỗ to bằng cả một tấm wafer silicon, tích hợp tính toán và bộ nhớ trên cùng một khối. Tuy vậy, đây chỉ là bước rời Nvidia ở khâu suy luận, còn việc huấn luyện các mô hình lớn OpenAI vẫn dựa vào GPU Nvidia.
OpenAI vừa tạo thêm một cột mốc đáng chú ý trong cuộc đua hạ tầng AI khi cho mô hình mới nhất của mình, GPT-5.6 Sol, chạy trên chip của Cerebras thay vì hạ tầng GPU quen thuộc của Nvidia. Điểm gây chú ý nhất là tốc độ tạo văn bản đạt tới 750 token mỗi giây, nhanh hơn nhiều lần so với cách triển khai một mô hình lớn tương đương trên GPU thông thường. Đây không phải một thử nghiệm nhỏ lẻ mà nằm trong khuôn khổ hợp tác trị giá hơn 10 tỷ USD giữa hai công ty. Bài viết giải thích GPT-5.6 Sol là gì, chip Cerebras đặc biệt ở đâu, và vì sao đây mới chỉ là bước rời Nvidia ở một phần công việc chứ chưa phải toàn bộ.
| Mô hình | GPT-5.6 Sol, ra mắt 10/7/2026 |
| Phần cứng | Cerebras Wafer-Scale Engine 3 (WSE-3) |
| Tốc độ | Tới 750 token mỗi giây |
| Loại tác vụ | Suy luận độ trễ thấp, không phải huấn luyện |
| Hợp đồng | Hơn 10 tỷ USD, tới 750 MW công suất |
| Vai trò Nvidia | Vẫn phụ trách huấn luyện mô hình nền tảng |
GPT-5.6 Sol là gì và nhanh tới đâu?
GPT-5.6 Sol là một biến thể trong dòng mô hình GPT-5.6 của OpenAI, ra mắt ngày 10/7/2026, được tối ưu đặc biệt cho tốc độ phản hồi. Khác với các phiên bản trước thường chạy trên cụm GPU, Sol được triển khai trên phần cứng Cerebras, cho phép đạt tốc độ tạo văn bản lên tới 750 token mỗi giây. Token là đơn vị nhỏ mà mô hình ngôn ngữ dùng để xử lý và sinh văn bản, mỗi token tương ứng khoảng vài ký tự, nên tốc độ càng cao thì câu trả lời hiện ra càng nhanh trước mắt người dùng.
Con số 750 token mỗi giây gây ấn tượng vì theo các nguồn quốc tế, nó nhanh hơn khoảng 10 lần so với việc chạy một mô hình nền tảng tương đương trên hạ tầng GPU truyền thống. Với các tác vụ dài như sinh mã nguồn, viết tài liệu hay tóm tắt văn bản lớn, sự khác biệt này rất dễ cảm nhận, gần như xóa bỏ cảm giác phải chờ mô hình gõ từng dòng. Đây chính là lý do OpenAI hướng Sol tới những ứng dụng cần phản hồi tức thì.
Chip Cerebras đặc biệt ở chỗ nào?
Điều khiến Cerebras làm được tốc độ cao nằm ở thiết kế chip khác thường. Trong khi GPU của Nvidia là những con chip nhỏ được cắt ra từ tấm wafer silicon rồi ghép lại thành cụm, chip Wafer-Scale Engine của Cerebras giữ nguyên cả một tấm wafer làm một khối duy nhất. Phiên bản WSE-3 có tới khoảng 4.000 tỷ transistor và hàng trăm nghìn nhân xử lý tối ưu cho AI trên cùng một khối, một quy mô mà chip thông thường không thể đạt được.
Lợi thế lớn nhất của cách làm này là giảm độ trễ. Khi tính toán và bộ nhớ nằm trên cùng một khối liền mạch, chip không phải liên tục hỏi dữ liệu từ các linh kiện khác qua đường truyền chậm hơn, vốn là điểm nghẽn của các cụm GPU khi chạy mô hình lớn. Nhờ đó, ở các tác vụ suy luận cần phản hồi nhanh, Cerebras có thể vượt trội về tốc độ. Câu chuyện về công ty này và loại chip khổng lồ đã được kể chi tiết trong bài về Cerebras, startup chip AI to bằng cái đĩa và đợt IPO đình đám.
Vì sao OpenAI vẫn chưa rời hẳn Nvidia?
Nhiều tiêu đề gây chú ý gọi đây là bước OpenAI rời bỏ Nvidia, nhưng thực tế cần được hiểu chính xác hơn. Hợp tác với Cerebras chỉ áp dụng cho khâu suy luận, tức là chạy mô hình đã huấn luyện xong để tạo phản hồi cho người dùng, và cụ thể là những tác vụ cần độ trễ thấp. Đây là một lớp hạ tầng bổ sung được tối ưu cho tốc độ, không phải sự thay thế toàn diện.
Trong khi đó, việc huấn luyện các mô hình nền tảng, giai đoạn tốn kém và nặng nhất, vẫn phụ thuộc vào Nvidia. Huấn luyện một mô hình lớn đòi hỏi hàng chục nghìn GPU kết nối băng thông cao chạy liên tục trong thời gian dài, một khối lượng công việc mà thiết kế của Cerebras không nhắm tới. Nói cách khác, OpenAI đang đa dạng hóa nhà cung cấp cho một phần công việc cụ thể, thay vì thay đổi toàn bộ chiến lược phần cứng. Việc phân vai này giúp công ty vừa tối ưu tốc độ cho người dùng, vừa giữ được năng lực huấn luyện cốt lõi.
Bối cảnh cạnh tranh chip AI, nơi Nvidia đang có thêm nhiều đối thủ. Nguồn: YouTube
Ý nghĩa với thị trường chip AI
Việc một khách hàng lớn và có ảnh hưởng như OpenAI đưa mô hình chủ lực chạy trên phần cứng ngoài Nvidia là một tín hiệu quan trọng. Trong nhiều năm, Nvidia gần như thống trị thị trường chip huấn luyện và suy luận AI, khiến các công ty phụ thuộc lớn vào nguồn cung của một nhà sản xuất duy nhất. Sự xuất hiện của những lựa chọn thay thế đủ mạnh, ít nhất ở một số tác vụ, giúp giảm bớt thế độc quyền này.
Cerebras không phải cái tên duy nhất tạo áp lực. Các ông lớn như Amazon, Google và Microsoft đều đang tự thiết kế chip AI riêng để bớt lệ thuộc vào Nvidia, một xu hướng đã được phản ánh trong bài về Amazon chi 20 tỷ USD làm chip Trainium thách thức Nvidia. Về dài hạn, cạnh tranh phần cứng đa dạng hơn có thể giúp hạ chi phí vận hành AI và mở ra nhiều lựa chọn công nghệ hơn, điều cuối cùng có lợi cho cả các doanh nghiệp lẫn người dùng cuối.
Tóm lại, việc GPT-5.6 Sol chạy trên chip Cerebras với tốc độ 750 token mỗi giây cho thấy hai điều. Thứ nhất, tốc độ phản hồi đang trở thành một mặt trận cạnh tranh mới của các mô hình AI, bên cạnh độ thông minh. Thứ hai, thế thống trị của Nvidia trong hạ tầng AI đang gặp thách thức thực sự, ít nhất ở mảng suy luận độ trễ thấp. Đây chưa phải dấu chấm hết cho vai trò của Nvidia, nhưng là bằng chứng rõ ràng rằng bản đồ phần cứng AI năm 2026 đã đa dạng hơn nhiều so với trước.