AI · TechVision · 04/08/2026 · 📖 ...

GPT-5.6 Sol chạy trên chip Cerebras, nhanh 750 token/giây

OpenAI vừa đưa mô hình mới nhất của mình, GPT-5.6 Sol, chạy trên chip Cerebras thay vì hạ tầng quen thuộc của Nvidia, đạt tốc độ tạo văn bản lên tới 750 token mỗi giây. Đây là bước đi đáng chú ý trong một mối quan hệ hợp tác trị giá hơn 10 tỷ USD, và là dấu hiệu rõ ràng cho thấy cuộc đua chip AI không còn là sân chơi một mình Nvidia. Bài viết giải thích GPT-5.6 Sol là gì, chip Cerebras đặc biệt ở đâu, và vì sao OpenAI vẫn chưa thể rời hoàn toàn Nvidia, qua lăng kính các nguồn quốc tế.

OpenAI dua GPT-5.6 Sol chay tren chip Cerebras WSE-3 nhanh 750 token

GPT-5.6 Sol chạy trên chip Cerebras đạt tốc độ tạo văn bản vượt trội so với hạ tầng GPU thông thường.

Tóm tắt nhanh

OpenAI đã ra mắt mô hình GPT-5.6 Sol vào ngày 10/7/2026 và cho chạy trên chip Cerebras WSE-3, đạt tốc độ tạo văn bản tới 750 token mỗi giây, nhanh hơn nhiều lần so với việc triển khai một mô hình lớn trên GPU Nvidia. Hai bên đã ký hợp đồng nhiều năm từ tháng 1/2026, trị giá hơn 10 tỷ USD, cung cấp tới 750 MW công suất tính toán chuyên cho tác vụ suy luận độ trễ thấp. Chip WSE-3 của Cerebras đặc biệt ở chỗ to bằng cả một tấm wafer silicon, tích hợp tính toán và bộ nhớ trên cùng một khối. Tuy vậy, đây chỉ là bước rời Nvidia ở khâu suy luận, còn việc huấn luyện các mô hình lớn OpenAI vẫn dựa vào GPU Nvidia.

#AI#OpenAI#Cerebras#Chip#Nvidia
📋 Nội dung bài viết
750 token/giây
Tốc độ tạo văn bản của GPT-5.6 Sol trên Cerebras
10/7/2026
Ngày OpenAI ra mắt mô hình GPT-5.6 Sol
Hơn 10 tỷ USD
Giá trị hợp đồng OpenAI ký với Cerebras
750 MW
Công suất tính toán Cerebras cung cấp cho OpenAI
4.000 tỷ
Số transistor trên một chip WSE-3 của Cerebras
Chỉ suy luận
Nvidia vẫn đảm nhận khâu huấn luyện mô hình

OpenAI vừa tạo thêm một cột mốc đáng chú ý trong cuộc đua hạ tầng AI khi cho mô hình mới nhất của mình, GPT-5.6 Sol, chạy trên chip của Cerebras thay vì hạ tầng GPU quen thuộc của Nvidia. Điểm gây chú ý nhất là tốc độ tạo văn bản đạt tới 750 token mỗi giây, nhanh hơn nhiều lần so với cách triển khai một mô hình lớn tương đương trên GPU thông thường. Đây không phải một thử nghiệm nhỏ lẻ mà nằm trong khuôn khổ hợp tác trị giá hơn 10 tỷ USD giữa hai công ty. Bài viết giải thích GPT-5.6 Sol là gì, chip Cerebras đặc biệt ở đâu, và vì sao đây mới chỉ là bước rời Nvidia ở một phần công việc chứ chưa phải toàn bộ.

📋 GPT-5.6 Sol trên Cerebras trong một cái nhìn
Mô hìnhGPT-5.6 Sol, ra mắt 10/7/2026
Phần cứngCerebras Wafer-Scale Engine 3 (WSE-3)
Tốc độTới 750 token mỗi giây
Loại tác vụSuy luận độ trễ thấp, không phải huấn luyện
Hợp đồngHơn 10 tỷ USD, tới 750 MW công suất
Vai trò NvidiaVẫn phụ trách huấn luyện mô hình nền tảng

GPT-5.6 Sol là gì và nhanh tới đâu?

GPT-5.6 Sol là một biến thể trong dòng mô hình GPT-5.6 của OpenAI, ra mắt ngày 10/7/2026, được tối ưu đặc biệt cho tốc độ phản hồi. Khác với các phiên bản trước thường chạy trên cụm GPU, Sol được triển khai trên phần cứng Cerebras, cho phép đạt tốc độ tạo văn bản lên tới 750 token mỗi giây. Token là đơn vị nhỏ mà mô hình ngôn ngữ dùng để xử lý và sinh văn bản, mỗi token tương ứng khoảng vài ký tự, nên tốc độ càng cao thì câu trả lời hiện ra càng nhanh trước mắt người dùng.

Con số 750 token mỗi giây gây ấn tượng vì theo các nguồn quốc tế, nó nhanh hơn khoảng 10 lần so với việc chạy một mô hình nền tảng tương đương trên hạ tầng GPU truyền thống. Với các tác vụ dài như sinh mã nguồn, viết tài liệu hay tóm tắt văn bản lớn, sự khác biệt này rất dễ cảm nhận, gần như xóa bỏ cảm giác phải chờ mô hình gõ từng dòng. Đây chính là lý do OpenAI hướng Sol tới những ứng dụng cần phản hồi tức thì.

Toc do suy luan AI 750 token moi giay tren chip Cerebras
Tốc độ suy luận cao giúp các tác vụ dài như sinh mã nguồn hiện kết quả gần như tức thì. Nguồn: YouTube

Chip Cerebras đặc biệt ở chỗ nào?

Điều khiến Cerebras làm được tốc độ cao nằm ở thiết kế chip khác thường. Trong khi GPU của Nvidia là những con chip nhỏ được cắt ra từ tấm wafer silicon rồi ghép lại thành cụm, chip Wafer-Scale Engine của Cerebras giữ nguyên cả một tấm wafer làm một khối duy nhất. Phiên bản WSE-3 có tới khoảng 4.000 tỷ transistor và hàng trăm nghìn nhân xử lý tối ưu cho AI trên cùng một khối, một quy mô mà chip thông thường không thể đạt được.

Lợi thế lớn nhất của cách làm này là giảm độ trễ. Khi tính toán và bộ nhớ nằm trên cùng một khối liền mạch, chip không phải liên tục hỏi dữ liệu từ các linh kiện khác qua đường truyền chậm hơn, vốn là điểm nghẽn của các cụm GPU khi chạy mô hình lớn. Nhờ đó, ở các tác vụ suy luận cần phản hồi nhanh, Cerebras có thể vượt trội về tốc độ. Câu chuyện về công ty này và loại chip khổng lồ đã được kể chi tiết trong bài về Cerebras, startup chip AI to bằng cái đĩa và đợt IPO đình đám.

Chip Cerebras Wafer Scale Engine to bang tam wafer silicon
Chip WSE-3 giữ nguyên cả tấm wafer làm một khối, tích hợp tính toán và bộ nhớ. Nguồn: YouTube

Vì sao OpenAI vẫn chưa rời hẳn Nvidia?

Nhiều tiêu đề gây chú ý gọi đây là bước OpenAI rời bỏ Nvidia, nhưng thực tế cần được hiểu chính xác hơn. Hợp tác với Cerebras chỉ áp dụng cho khâu suy luận, tức là chạy mô hình đã huấn luyện xong để tạo phản hồi cho người dùng, và cụ thể là những tác vụ cần độ trễ thấp. Đây là một lớp hạ tầng bổ sung được tối ưu cho tốc độ, không phải sự thay thế toàn diện.

Trong khi đó, việc huấn luyện các mô hình nền tảng, giai đoạn tốn kém và nặng nhất, vẫn phụ thuộc vào Nvidia. Huấn luyện một mô hình lớn đòi hỏi hàng chục nghìn GPU kết nối băng thông cao chạy liên tục trong thời gian dài, một khối lượng công việc mà thiết kế của Cerebras không nhắm tới. Nói cách khác, OpenAI đang đa dạng hóa nhà cung cấp cho một phần công việc cụ thể, thay vì thay đổi toàn bộ chiến lược phần cứng. Việc phân vai này giúp công ty vừa tối ưu tốc độ cho người dùng, vừa giữ được năng lực huấn luyện cốt lõi.

VIDEO · Cuộc đua chip AI và áp lực cạnh tranh với Nvidia

Bối cảnh cạnh tranh chip AI, nơi Nvidia đang có thêm nhiều đối thủ. Nguồn: YouTube

Ý nghĩa với thị trường chip AI

Việc một khách hàng lớn và có ảnh hưởng như OpenAI đưa mô hình chủ lực chạy trên phần cứng ngoài Nvidia là một tín hiệu quan trọng. Trong nhiều năm, Nvidia gần như thống trị thị trường chip huấn luyện và suy luận AI, khiến các công ty phụ thuộc lớn vào nguồn cung của một nhà sản xuất duy nhất. Sự xuất hiện của những lựa chọn thay thế đủ mạnh, ít nhất ở một số tác vụ, giúp giảm bớt thế độc quyền này.

Cerebras không phải cái tên duy nhất tạo áp lực. Các ông lớn như Amazon, Google và Microsoft đều đang tự thiết kế chip AI riêng để bớt lệ thuộc vào Nvidia, một xu hướng đã được phản ánh trong bài về Amazon chi 20 tỷ USD làm chip Trainium thách thức Nvidia. Về dài hạn, cạnh tranh phần cứng đa dạng hơn có thể giúp hạ chi phí vận hành AI và mở ra nhiều lựa chọn công nghệ hơn, điều cuối cùng có lợi cho cả các doanh nghiệp lẫn người dùng cuối.

Thi truong chip AI da dang hon voi nhieu doi thu cua Nvidia
Bản đồ phần cứng AI năm 2026 đa dạng hơn khi nhiều đối thủ cùng cạnh tranh. Nguồn: YouTube
💡 Hiểu cho đúng: Suy luận là khi mô hình tạo phản hồi từ dữ liệu đã học, còn huấn luyện là quá trình dạy mô hình từ đầu. Tin này nói về việc OpenAI dùng Cerebras cho suy luận nhanh, không có nghĩa họ ngừng dùng Nvidia để huấn luyện.

Tóm lại, việc GPT-5.6 Sol chạy trên chip Cerebras với tốc độ 750 token mỗi giây cho thấy hai điều. Thứ nhất, tốc độ phản hồi đang trở thành một mặt trận cạnh tranh mới của các mô hình AI, bên cạnh độ thông minh. Thứ hai, thế thống trị của Nvidia trong hạ tầng AI đang gặp thách thức thực sự, ít nhất ở mảng suy luận độ trễ thấp. Đây chưa phải dấu chấm hết cho vai trò của Nvidia, nhưng là bằng chứng rõ ràng rằng bản đồ phần cứng AI năm 2026 đã đa dạng hơn nhiều so với trước.

Câu hỏi thường gặp
GPT-5.6 Sol là biến thể mới trong dòng mô hình GPT-5.6 của OpenAI, ra mắt ngày 10/7/2026, được tối ưu cho tốc độ phản hồi rất nhanh. Điểm khác biệt lớn nhất là Sol được triển khai trên phần cứng Cerebras thay vì hạ tầng GPU truyền thống, cho phép tạo văn bản với tốc độ lên tới 750 token mỗi giây, phù hợp các ứng dụng cần phản hồi gần như tức thì như trợ lý lập trình hay chatbot tương tác nhanh.
Chip Wafer-Scale Engine của Cerebras có kích thước bằng cả một tấm wafer silicon, thay vì cắt nhỏ thành nhiều con chip riêng lẻ như GPU. Nhờ đặt phần tính toán và bộ nhớ trên cùng một khối liền mạch, chip giảm được độ trễ khi phải trao đổi dữ liệu giữa nhiều linh kiện, vốn là điểm nghẽn của các cụm GPU khi chạy mô hình lớn. Đây là lý do Cerebras đạt tốc độ suy luận rất cao ở các tác vụ độ trễ thấp.
Không. Hợp tác với Cerebras chỉ áp dụng cho khâu suy luận, tức là chạy mô hình đã huấn luyện để tạo phản hồi cho người dùng, ở những tác vụ cần độ trễ thấp. Việc huấn luyện các mô hình nền tảng, vốn cần hàng chục nghìn GPU kết nối băng thông cao trong thời gian dài, OpenAI vẫn dựa vào hạ tầng Nvidia. Cerebras đóng vai trò một lớp bổ sung tối ưu cho tốc độ, không thay thế vai trò cốt lõi của Nvidia.
Tốc độ tạo văn bản càng cao thì người dùng càng ít phải chờ, đặc biệt với các tác vụ dài như sinh mã nguồn, viết tài liệu hay tóm tắt văn bản lớn. Mức 750 token mỗi giây nhanh hơn nhiều lần so với việc chạy một mô hình lớn tương đương trên GPU thông thường, giúp trải nghiệm gần như tức thì. Với các ứng dụng như trợ lý lập trình, tốc độ này tạo khác biệt rõ rệt về cảm giác mượt mà khi làm việc.
Hai bên chính thức ký thỏa thuận nhiều năm từ tháng 1/2026, với giá trị được cho là hơn 10 tỷ USD. Thỏa thuận cung cấp tới 750 MW công suất tính toán trải dài tới khoảng năm 2028 hoặc 2029, tập trung riêng cho các tác vụ suy luận độ trễ thấp phục vụ những sản phẩm chủ lực của OpenAI như ChatGPT và các công cụ lập trình.
Việc một khách hàng lớn như OpenAI đưa mô hình chủ lực chạy trên phần cứng ngoài Nvidia là tín hiệu cho thấy thị trường chip AI đang mở rộng, không còn phụ thuộc gần như tuyệt đối vào một nhà cung cấp. Các đối thủ như Cerebras, cùng chip tự thiết kế của Amazon, Google hay Microsoft, đang tạo áp lực cạnh tranh. Về dài hạn, cạnh tranh có thể giúp hạ chi phí và đa dạng hóa nguồn cung phần cứng cho ngành AI.
Nguyễn Tấn Thiên Long
Nguyễn Tấn Thiên Long
Founder LongTechVision. Theo dõi hạ tầng AI, chip và cuộc cạnh tranh phần cứng cho các mô hình ngôn ngữ lớn.
Nguồn tham khảo
Tom's Hardware: OpenAI on Cerebras chips
tomshardware.com · venturebeat.com · forbes.com
Bình luận
← Quay lại Tech News techvision.click
🎧 AI Đọc Bài GPT-5.6 Sol chạy trên chip Cerebras, nhanh 750 token/giây…
0 / 0