
Bí ẩn DeepSeek-V4-Pro: Khi 'ba phiên bản' không phải là model, mà là môi trường
Lê Tuấn
Ngày 15 tháng 8, tôi nhận được một tin nhắn từ một trader AI chuyên săn lùng các phiên bản ẩn của DeepSeek. Anh ta kể rằng khi gọi API deepseek-v4-pro, thay đổi IP hoặc tạo session mới, anh ta thấy ba 'phong cách suy luận' khác nhau: một thường bắt đầu bằng 'Let me', giống V4 Pro Preview; một hay nói 'The user wants me', hao hao V4 Flash; và một thứ ba nặng về 'we', được gọi là 'God Version V4 Pro'. Cộng đồng AI sôi sục: phải chăng DeepSeek đang giấu nhiều model sau API và dùng routing mechanism để phân phối? Nhưng tôi, sau 10 năm trong ngành, biết rằng những câu chuyện như thế này thường dẫn đến một ngã rẽ bất ngờ - và lần này, câu trả lời nằm ở source code, không phải ở model weights.
Bối cảnh: DeepSeek-V4-Pro là một trong những model AI mạnh nhất hiện nay, được phát hành vào ngày 13 tháng 8 dưới dạng API. Chỉ sau hai ngày, cộng đồng phát hiện ra sự bất thường: các session API không đồng nhất. Một số người dùng báo cáo rằng hiệu suất thay đổi rõ rệt khi họ chuyển đổi giữa các vùng địa lý hoặc tạo lại session. Điều này dấy lên nghi ngờ về một hệ thống multi-model ngầm. Tuy nhiên, khi tôi đào sâu vào mã nguồn của DeepSeek Harness, một commit quan trọng ngày 10 tháng 8 hiện lên: 'fix(preset): align minimal agent with RL composition'. Commit này đảm bảo rằng Minimal Agent khớp với môi trường Agent được sử dụng trong quá trình huấn luyện reinforcement learning (RL). Tài liệu chính thức cho thấy preset Minimal bao gồm một system prompt tối giản, một môi trường Bash bền vững, các công cụ chỉnh sửa cụ thể, và một chính sách nén (compaction policy) - trong khi bỏ qua các prompt nhận dạng, web prompts, và mô tả công cụ thừa. Điều này gợi ý rằng DSH Minimal không phải là 'phiên bản cắt giảm' của Standard, mà là một mô phỏng trung thực môi trường Agent thực tế mà model gặp phải khi huấn luyện.
Cốt lõi của vấn đề nằm ở sự khác biệt giữa các môi trường Harness. Các bài kiểm tra cộng đồng cho thấy cùng một DeepSeek V4 Pro đạt điểm khác nhau: DSH Standard: 91; DSH PTC: 92; DSH Minimal: 99/96. Điểm số cao vọt lên khi môi trường được điều chỉnh để giống với RL training. Một tester đã phát triển plugin 'Anchored Standard': yêu cầu đầu tiên mô phỏng Minimal, chỉ mở shell và read tools, sau khi hoàn thành tool call đầu tiên, khôi phục đầy đủ Standard toolset, kết quả đạt 98/99 điểm. Điều này chứng minh rằng chìa khóa cho hiệu suất Agent của V4 Pro không nằm ở số lượng công cụ cuối cùng, mà ở những gì model gặp đầu tiên: System Prompt + Tool Schema + Agent Scaffold. Từ đó, cái gọi là 'ba model DeepSeek' thực chất là sự kết hợp của hai lớp yếu tố: một mặt, sự khác biệt trong môi trường API service, cấu hình triển khai, hoặc gray instances; mặt khác, liệu model có bước vào một môi trường Agent gần với phân phối huấn luyện RL hay không. Tuy nhiên, DeepSeek chưa xác nhận điều này. Tài liệu API chính thức chỉ ra rằng deepseek-v4-pro tương ứng với phiên bản DeepSeek-V4-Pro-0813 và không tiết lộ cơ chế routing tự động đa model.
Góc nhìn phản trực giác: Điều thú vị là nhiều người trong cộng đồng đã lao vào kết luận 'có nhiều model ẩn' bởi vì đó là một narrative hấp dẫn. Từ kinh nghiệm của tôi trong crypto, tôi đã thấy điều tương tự: khi Uniswap V3 ra mắt, nhiều trader tin rằng có nhiều phiên bản routing khác nhau, nhưng thực ra chỉ là do môi trường thanh khoản khác biệt. Tương tự, ở đây, sự khác biệt không phải từ model weights mà từ môi trường Agent. Điều này cho thấy một điểm mù lớn: chúng ta thường đổ lỗi cho model khi hiệu suất thay đổi, nhưng thực tế hệ thống prompt và scaffolding mới là yếu tố quyết định. Trong một thị trường đi ngang, những tín hiệu kỹ thuật như commit 'fix(preset)' dễ bị bỏ qua, nhưng chúng ta nên chú ý đến chúng hơn là những câu chuyện giật gân.
Takeaway: Câu chuyện DeepSeek-V4-Pro dạy chúng ta rằng trong thế giới AI và crypto, giá trị thực sự không đến từ bản thân sản phẩm - mà từ ngữ cảnh sử dụng. Một model mạnh trong môi trường huấn luyện có thể yếu đi nếu không được triển khai đúng cách. Điều này đặt ra câu hỏi: liệu các dự án crypto của chúng ta có đang tạo ra những 'phiên bản ẩn' chỉ vì chúng ta thay đổi môi trường thử nghiệm? Và nếu vậy, chúng ta đang đánh giá sai giá trị thực sự của chúng. Khi thị trường tiếp tục đi ngang, hãy nhìn vào những chi tiết nhỏ nhặt như commit trong source code - đó là nơi những câu chuyện thực sự được viết.