Google News

AI V4 Pro của DeepSeek gây thất vọng

SVO - Mô hình AI V4 Pro mới được cập nhật của DeepSeek gặp khó khăn trong các bài kiểm tra hiệu năng nhưng lại thể hiện xuất sắc ở mảng an ninh mạng.

Mô hình của công ty khởi nghiệp AI Trung Quốc này gây ấn tượng trong các lĩnh vực chuyên biệt như an ninh mạng, song lại khiến một số nhà phát triển thất vọng về năng lực tổng thể.

DeepSeek, một công ty khởi nghiệp về trí tuệ nhân tạo (AI) của Trung Quốc, đã âm thầm phát hành DeepSeek-V4-Pro-0813, phiên bản cập nhật cho mô hình chủ lực mới nhất của họ. Sản phẩm này khiến một số nhà phát triển cảm thấy chưa ấn tượng về năng lực tổng thể và thất vọng về mức giá, nhưng lại gây ấn tượng với các nhà nghiên cứu trong những lĩnh vực chuyên biệt như an ninh mạng.

Bản cập nhật âm thầm cho phiên bản thử nghiệm (preview) hồi tháng Tư này đi kèm với một thông báo ngắn gọn trên trang web chính thức của DeepSeek, trong đó nêu rằng mô hình có "năng lực tác nhân (agent capability) được tăng cường đáng kể". Tuy nhiên, thông báo này đã bị gỡ bỏ chỉ sau 1 ngày. Động thái này diễn ra sau khi công ty ra mắt mô hình V4 Flash nhỏ gọn hơn, sản phẩm từng gây chấn động "Thung lũng Silicon" vào tháng trước nhờ hiệu quả chi phí cực cao.

Năng lực tác nhân (agent capability) trong trí tuệ nhân tạo là khả năng tự chủ nhận thức môi trường, lập kế hoạch, sử dụng công cụ và thực hiện chuỗi hành động nhiều bước để đạt được mục tiêu cụ thể mà không cần con người can thiệp liên tục.

Tuy nhiên, các kết quả đánh giá hiệu năng (benchmark) ban đầu cho thấy mô hình chủ lực mới này đang gặp khó khăn trong việc cạnh tranh với các đối thủ hàng đầu.

DeepSeek-V4-Pro-0813 đạt 53 điểm trên chỉ số Artificial Analysis Intelligence Index, ngang bằng với GLM-5.2 của Zhipu AI (ra mắt tháng Sáu), nhưng kém 4 điểm so với mô hình tầm trung Terra thuộc dòng GPT-5.6 mới nhất của OpenAI và kém 7 điểm so với Kimi K3 của Moonshot AI.

Trên chỉ số Vals Index, do Vals AI (có trụ sở tại San Francisco) tổng hợp để đánh giá các mô hình dựa trên nhiều tiêu chí, mô hình mới của DeepSeek xếp thứ 12. Nó đứng sau thế hệ GPT-5.5 cũ hơn của OpenAI và cũng thua xa các hệ thống tiên tiến như Kimi K3 hay Claude Opus 5 của Anthropic.

Theo Vals AI, mô hình này gặp khó khăn ở hai lĩnh vực cụ thể: Hoàn thành tác vụ trong môi trường dòng lệnh (terminal) biệt lập (sandbox) và tạo các mô hình tài chính phức tạp trong bảng tính Excel.

Trên mạng xã hội, những kết quả ban đầu này khiến một số nhà phát triển và người quan sát trong ngành nhận xét mô hình của công ty có trụ sở tại Hàng Châu này là "gây thất vọng". Nhiều người dùng còn chỉ ra các vấn đề như việc mô hình dừng hoạt động giữa chừng khi thực hiện các tác vụ lập trình dài.

deepseek.png

Bất chấp những phản hồi trái chiều, hiệu suất của mô hình trong lĩnh vực an ninh mạng lại rất nổi bật. Theo công ty an ninh mạng Aikido Security của Bỉ, DeepSeek-V4-Pro-0813 đã vượt qua tất cả các mô hình khác được thử nghiệm trong việc phát hiện các lỗ hổng hệ thống.

Ông Philippe Dourassov, nhà nghiên cứu tại Aikido, cho biết mặc dù mô hình này gặp vấn đề về "độ chính xác kém", nó lại phát hiện được nhiều lỗ hổng bảo mật hơn hẳn so với Opus 5 của Anthropic và Qwen 3.8 của Alibaba Group Holding.

Khác với quy trình phát hành thường thấy của các phòng thí nghiệm AI, DeepSeek vẫn chưa công bố bài viết kỹ thuật nào về mô hình mới này. Mức giá cho phiên bản Pro chính thức cũng vấp phải những ý kiến ​​trái chiều, đặc biệt là sau khi mô hình V4 Flash (vốn có giá cực rẻ) được ra mắt vào ngày 31/7 và nhận được nhiều lời khen ngợi.

DeepSeek-V4-Pro-0813 có giá khoảng 44 cent Mỹ cho mỗi triệu token đầu vào (tức là có thể nạp 750.000 từ tiếng Anh vào AI với giá khoảng 11 nghìn đồng), mức giá mà Artificial Analysis đánh giá là "hơi cao" so với mức trung vị thị trường là 33 cent (khoảng 8.600 đồng) ​​và 87 cent cho mỗi triệu token đầu ra (nghĩa là phải trả khoảng 21.500 đồng cho mỗi 750.000 từ mà mô hình AI tạo ra), mức giá được coi là "hợp lý".

Theo Chỉ số Trí tuệ của Artificial Analysis (Artificial Analysis Intelligence Index), với chi phí 6 cent cho mỗi tác vụ, mô hình này đắt hơn một chút so với GPT-5.6 Luna (phiên bản gọn nhẹ của OpenAI) có giá 5 cent, nhưng vẫn rẻ hơn tới gần 93% so với Kimi K3 của Moonshot AI (có giá 84 cent).

Tuần trước, DeepSeek thông báo sẽ tăng giá "đáng kể" do nhu cầu tăng vọt, đồng thời khuyến nghị người dùng nên lên kế hoạch sử dụng sao cho phù hợp. Trong khi đó, DeepSeek dự kiến ​​sẽ sớm ra mắt một sản phẩm có tên "Harness", một khung phần mềm tương tự như Claude Code, cho phép các mô hình ngôn ngữ lớn hoạt động như những tác nhân AI tự hành.