Vào ngày 21 tháng 07 năm 2026 (giờ Bắc Kinh), Alphabet đóng cửa ở mức 351,37 USD, tăng 1,52% trong ngày. Cùng ngày, NVIDIA kết phiên ở mức 203,28 USD, ghi nhận mức tăng 0,23%.
Nguyên nhân dẫn đến sự chênh lệch giá này là một báo cáo từ trang tin công nghệ The Information: Google đang phát triển một loại chip máy chủ mới, tên mã nội bộ là Frozen v2, với mục tiêu tích hợp vĩnh viễn một phần kiến trúc mô hình lớn Gemini vào phần cứng. Điều này sẽ cho phép hiệu suất xử lý token cao hơn từ 6 đến 10 lần trên mỗi đơn vị điện năng so với TPU hiện tại. Ngay khi thông tin được công bố, cổ phiếu Alphabet đã tăng gần 3,7% trong phiên giao dịch nội ngày.
Một loại chip dự kiến triển khai sau hai năm đã khiến thị trường mạnh dạn mua vào dựa trên bản thiết kế. Logic đằng sau động thái này vượt xa việc ra mắt thêm một chip AI nữa—nó báo hiệu khả năng viết lại các quy tắc cạnh tranh hạ tầng AI.
Vì Sao Các Ông Lớn Điện Toán Đám Mây Chuyển Từ Mua Chip Sang Tự Thiết Kế Chip?
Trong thập kỷ vừa qua, cấu trúc thị trường hạ tầng AI xoay quanh một trục chính: GPU của NVIDIA, hệ sinh thái phần mềm CUDA và các trung tâm dữ liệu ngày càng mở rộng. Lộ trình này rõ ràng và hiệu quả—chip tính toán đa năng thích ứng với nhiều loại tác vụ AI, quy mô lớn giúp liên tục giảm chi phí và tăng hiệu suất.
Tuy nhiên, bức tranh này đang thay đổi. Các nhà cung cấp đám mây lớn đồng loạt chuyển sang tự thiết kế chip:
| Công ty | Chip độc quyền | Tiến độ |
|---|---|---|
| TPU (Tensor Processing Unit) | Đã phát triển đến thế hệ thứ bảy Ironwood, triển khai năm 2026 | |
| Amazon | Trainium / Inferentia | Doanh thu hàng năm vượt 20 tỷ USD đầu năm 2026 |
| Microsoft | Maia 200 | Ra mắt tháng 01 năm 2026, sử dụng tiến trình 3nm |
| Meta | MTIA (Iris) | Dự kiến sản xuất hàng loạt tháng 09 năm 2026 |
Xu hướng này được thúc đẩy bởi nhiều yếu tố. Đầu tiên là chi phí. TPU do Google tự phát triển có thể giảm chi phí tính toán AI tới 30%. Mảng chip độc quyền của AWS đạt doanh thu 20 tỷ USD/năm vào đầu năm 2026. Khi AI chuyển từ "có thể làm được không" sang "có hiệu quả về chi phí không", chi phí trên mỗi token trở thành biến số cạnh tranh trung tâm.
Tiếp theo là bảo đảm nguồn cung. Tình trạng thiếu hụt năng lực tính toán đã trở thành vấn đề cấp bách nội bộ tại Google. Các báo cáo cho thấy thiếu compute không chỉ làm gia tăng cạnh tranh tài nguyên nội bộ, mà còn buộc Google Cloud phải từ chối một số đối tác khách hàng bên ngoài. Tháng 06 năm 2026, Google đồng ý trả cho SpaceX gần 1 tỷ USD mỗi tháng để bù đắp thiếu hụt compute. Quý I năm 2026, chi tiêu vốn của Alphabet đạt 35,7 tỷ USD, với dự báo cả năm tăng lên 180–190 tỷ USD—gấp đôi mức 91,4 tỷ USD năm 2025. Cùng quý đó, doanh thu Google Cloud đạt 20 tỷ USD, tăng 63% so với cùng kỳ năm trước, và backlog hợp đồng tăng vọt từ 240 tỷ USD quý trước lên 462 tỷ USD. Ban lãnh đạo cho biết trong cuộc họp công bố kết quả kinh doanh rằng nhu cầu AI chưa từng có tiền lệ và công ty vẫn bị giới hạn bởi năng lực tính toán.
Khi tốc độ tăng trưởng nhu cầu liên tục vượt khả năng mở rộng nguồn cung, việc tự phát triển chip chuyển từ "tùy chọn" sang "bắt buộc".
Logic "Đóng Băng" của Frozen v2: Vì Sao Việc Tích Hợp Kiến Trúc Mô Hình Vào Silicon Giúp Tăng Hiệu Suất Gấp Mười Lần
Để hiểu giá trị của Frozen v2, cần nắm được cơ chế hoạt động của chip AI truyền thống.
Trong kiến trúc thông thường, mô hình AI được lưu trữ trong bộ nhớ. Chip đọc trọng số và tham số kiến trúc từ bộ nhớ, thực hiện tính toán ở các đơn vị xử lý, rồi ghi kết quả trở lại bộ nhớ. Mỗi token sinh ra đều chạy qua chu trình này. Phần lớn điện năng tiêu tốn cho việc di chuyển dữ liệu, trong khi phần tính toán thực tế chỉ chiếm tỷ lệ nhỏ.
Frozen v2 đi theo hướng khác: tích hợp kiến trúc mạng nơ-ron Gemini—bao gồm cấu trúc phân cấp, cơ chế attention đa đầu, kết nối dư và các thành phần cốt lõi khác—trực tiếp vào mạch vật lý ngay từ khâu thiết kế chip. Những cấu trúc vốn cần đọc và tính toán lặp lại giờ trở thành một phần của mạch.
Khái niệm này trong ngành bán dẫn gọi là ASIC (Application-Specific Integrated Circuit). Máy đào Bitcoin là ASIC, chip ISP trên điện thoại cũng vậy—hy sinh tính đa năng để đạt hiệu quả tối đa cho một tác vụ cụ thể. Tuy nhiên, chưa ai dám xây ASIC cho mô hình lớn, vì chu kỳ cập nhật mô hình nhanh, chu kỳ thiết kế chip lại dài, đến khi chip sản xuất xong thì mô hình đã lỗi thời.
Frozen v2 đặt cược rằng kiến trúc nền tảng của Gemini đã đủ ổn định để mã hóa vào silicon. Từ Gemini 1.0 ra mắt tháng 12 năm 2023 đến 3.5 Flash, các thành phần cốt lõi của kiến trúc Transformer—attention đa đầu, mạng feed-forward, chuẩn hóa lớp—không thay đổi căn bản. Đổi mới thực sự diễn ra ở quy mô mô hình, dữ liệu huấn luyện và tối ưu sau huấn luyện, chứ không phải tầng hạ tầng.
Frozen v2 khóa kiến trúc, nhưng trọng số vẫn có thể cập nhật. Kế hoạch Frozen v1 ban đầu cố gắng tích hợp cả kiến trúc lẫn trọng số mô hình, nhưng Google đã bỏ phương án này vì chip chỉ chạy được một phiên bản Gemini, mỗi lần mô hình cập nhật là chip lại lỗi thời. Frozen v2 chọn giải pháp "khóa bộ khung, không khóa phần thịt".
Xét về luồng dữ liệu, hiệu suất của Frozen v2 được phân tích như sau:
Kiến trúc mô hình tích hợp cứng → giảm giải mã lệnh và đọc tham số → giảm di chuyển dữ liệu giữa chip và bộ nhớ → giảm tiêu thụ điện trên mỗi token → tăng tốc độ xử lý token trên mỗi đơn vị điện năng lên 6–10 lần
Báo cáo cho biết chip Frozen sẽ trở thành nhánh chuyên biệt trong danh mục chip độc quyền của Google, chứ không thay thế TPU đa năng. Hiện Google coi Frozen v2 là dự án thử nghiệm, chưa có kế hoạch sản xuất hàng loạt như TPU. Mục tiêu triển khai là năm 2028.
Từ "Cuộc Đua Số Lượng GPU" Đến "Cạnh Tranh Chi Phí Trên Mỗi Token"
Ý nghĩa của Frozen v2 không nằm ở khả năng sản xuất đại trà, mà ở sự thay đổi logic cạnh tranh.
Lịch sử, chỉ số cốt lõi trong cạnh tranh chip AI là "ai sở hữu nhiều GPU nhất". NVIDIA đã xây dựng vị thế không thể bị vượt qua—đầu năm 2026, NVIDIA nắm khoảng 86% thị phần chip tăng tốc AI và trung tâm dữ liệu. TrendForce ước tính thị phần chip AI toàn cầu của NVIDIA sẽ khoảng 64% năm 2026. Quý I năm 2026 (quý I tài chính 2027 của NVIDIA), doanh thu trung tâm dữ liệu của NVIDIA đạt 75,25 tỷ USD, tăng 92% so với cùng kỳ năm trước.
Nhưng Frozen v2 mở ra chiều cạnh tranh mới: "ai cung cấp compute AI nhiều nhất với chi phí thấp nhất trên mỗi đơn vị". Khi AI chuyển từ huấn luyện sang suy luận quy mô lớn, chi phí điện, chip và vận hành trung tâm dữ liệu trên mỗi token sẽ quyết định tính khả thi của mô hình kinh doanh.
Google có lợi thế cấu trúc: TPU nhàn rỗi có thể được hấp thụ nội bộ—tích hợp trực tiếp vào hoạt động cloud của Google—trong khi NVIDIA không có mảng cloud đủ lớn để tận dụng phần cứng dư thừa. Điều này giúp Google linh hoạt hơn trong hoạch định năng lực và quản lý rủi ro với chip độc quyền.
Ngoài ra, Google đang mở rộng hệ sinh thái TPU ra thị trường bên ngoài. Báo cáo cho biết Google đã đàm phán với nhiều nhà cung cấp cloud chuyên nghiệp "Neo-cloud", khuyến khích họ bổ sung tùy chọn TPU vào dịch vụ. Anthropic, Apple và Meta đã trở thành khách hàng TPU bên ngoài. Liên doanh giữa Google và Blackstone đang xây dựng năng lực tính toán TPU công suất 500 megawatt. Nếu nhiều công ty công nghệ chuyển khối lượng công việc sang TPU hoặc chip độc quyền của Google, điều này không chỉ làm giảm thị phần của NVIDIA mà còn có thể thu hẹp quyền định giá của họ.
Tuy nhiên, quá trình này gặp phải những ràng buộc thực tế. TSMC là nút thắt mà mọi nhà thiết kế chip đều phải vượt qua; Google dựa vào Broadcom làm trung gian để đảm bảo năng lực sản xuất. Phân bổ cho năm 2027 đang được chốt, và tỷ lệ của Google sẽ phản ánh trực tiếp thái độ của TSMC với mảng TPU. Trong khi đó, Google vẫn là một trong những khách hàng lớn nhất của NVIDIA, mua hàng chục nghìn GPU mỗi năm để huấn luyện các mô hình lớn nhất. Mối quan hệ "vừa là đối thủ vừa là khách hàng lớn nhất" khiến bức tranh cạnh tranh càng phức tạp.
Chi Phí và Giới Hạn của Chuyên Môn Hóa
Con đường kỹ thuật của Frozen v2 không phải không có đánh đổi. Báo cáo nhấn mạnh: chip chỉ tương thích với các mô hình Gemini tương lai nếu Google giữ nguyên kiến trúc nền tảng. Nếu cấu trúc nền thay đổi, phần tích hợp cứng vào silicon có thể trở nên lỗi thời.
Đồng thời, mảng AI của Google đang đối mặt với thách thức trước mắt. Báo cáo cho biết Gemini Pro thế hệ tiếp theo bị trì hoãn ra mắt, nhiều nhà nghiên cứu AI cấp cao đã chuyển sang đối thủ. Các mô hình AI Trung Quốc hiện chiếm 45% lượng token sử dụng tại các doanh nghiệp Mỹ. Trong khi chip chuyên biệt vẫn nằm trên lộ trình năm 2028, ưu tiên trước mắt của Google là ổn định tốc độ cập nhật mô hình và giữ chân nhân tài.
Ngoài ra, Alphabet vừa hoàn tất huy động vốn cổ phần trị giá 84,75 tỷ USD—một trong những đợt phát hành thứ cấp lớn nhất lịch sử Mỹ—chủ yếu để xây dựng trung tâm dữ liệu, triển khai TPU Ironwood thế hệ thứ bảy và tiếp tục mua GPU NVIDIA. Frozen v2 phải đến năm 2028 mới xuất hiện; nguồn vốn này đang được sử dụng ngay bây giờ.
Kết Luận
Cổ phiếu Alphabet tăng 1,52% nhờ thông tin về Frozen v2, trong khi NVIDIA chỉ tăng nhẹ 0,23%. Khoảng chênh này có thể phản ánh cách thị trường định giá hai hướng cạnh tranh: một dựa trên rào cản quy mô của chip tính toán đa năng, một dựa trên cuộc cách mạng hiệu suất của chip chuyên biệt.
Frozen v2 vẫn là dự án thử nghiệm, với thời gian triển khai năm 2028 nên chưa thể thách thức vị thế thị trường của NVIDIA trong ngắn hạn. Tuy nhiên, hướng đi mà nó thể hiện—từ "ai sở hữu nhiều GPU nhất" sang "ai cung cấp compute AI nhiều nhất với chi phí thấp nhất"—đang trở thành xu hướng cấu trúc của toàn ngành.
Thị trường chip AI dự kiến tăng từ khoảng 61,8 tỷ USD năm 2025 lên 84,2 tỷ USD năm 2026. Trong thị trường tăng trưởng nhanh này, sự đan xen giữa chuyên biệt và đa năng sẽ định hình cấu trúc chi phí và động lực cạnh tranh của hạ tầng AI trong thập kỷ tới. Thành công của Frozen v2 còn bỏ ngỏ, nhưng tư duy mà nó đại diện—thiết kế chip cho mô hình, thay vì ép mô hình chạy trên chip—đã bắt đầu định hình lại cách ngành công nghiệp bàn về compute AI.
FAQ
Q: Chip Frozen v2 của Google cải thiện hiệu suất như thế nào so với TPU hiện tại?
Các kỹ sư Google ước tính Frozen v2 có thể xử lý token với hiệu suất cao hơn từ 6 đến 10 lần trên mỗi đơn vị điện năng so với TPU mới nhất của công ty. Sự cải thiện này chủ yếu nhờ tích hợp kiến trúc mô hình Gemini vào chip, giảm tiêu thụ năng lượng cho việc di chuyển dữ liệu và tính toán dư thừa.
Q: Frozen v2 có thay thế GPU của NVIDIA không?
Không trong ngắn hạn. Frozen v2 là chip chuyên biệt dành cho mô hình Gemini; nó không thay thế TPU đa năng, càng không thay thế GPU của NVIDIA. Google vẫn mua hàng chục nghìn GPU NVIDIA mỗi năm để huấn luyện các mô hình lớn nhất.
Q: Khi nào Frozen v2 sẽ được triển khai chính thức?
Các báo cáo cho biết mục tiêu triển khai của Google là năm 2028. Dự án hiện được coi là thử nghiệm, chưa có kế hoạch sản xuất hàng loạt như TPU.
Q: Vì sao Alphabet tự phát triển chip AI?
Có ba động lực chính: giảm phụ thuộc vào NVIDIA, kiểm soát chi phí tính toán tăng cao và giải quyết tình trạng thiếu compute nghiêm trọng nội bộ. Quý I năm 2026, doanh thu Google Cloud đạt 20 tỷ USD, tăng 63% so với cùng kỳ năm trước, nhưng hạn chế về compute đã cản trở tăng trưởng thêm.
Q: Rủi ro lớn nhất trong hướng kỹ thuật của Frozen v2 là gì?
Rủi ro lớn nhất là chi phí cho sự thiếu linh hoạt. Chip chỉ tương thích với các phiên bản Gemini tiếp theo sử dụng cùng kiến trúc nền. Nếu mô hình thay đổi cấu trúc, thiết kế tích hợp cứng vào silicon có thể trở nên lỗi thời. Ngoài ra, chu kỳ thiết kế chip dài hơn chu kỳ cập nhật mô hình, đó là lý do chưa ai từng dám xây ASIC cho mô hình lớn.




