Ngày 15 tháng 8, cộng đồng AI xôn xao về khả năng tồn tại nhiều phiên bản của DeepSeek-V4-Pro. Một số người dùng phát hiện khi gọi API deepseek-v4-pro, thay đổi IP hoặc tạo session mới dẫn đến ba 'phong cách suy luận' khác nhau: một thường bắt đầu bằng 'Let me', giống V4 Pro Preview; một hay nói 'The user wants me', tựa V4 Flash; và một thứ ba dùng nhiều 'we', được gọi là 'God Version V4 Pro'. Khi session đã vào một chế độ, hiệu suất có xu hướng ổn định. Cộng đồng suy đoán DeepSeek đang giấu nhiều model đằng sau API và phân phối qua cơ chế routing. Tuy nhiên, phân tích sâu hơn mã nguồn DeepSeek Harness lại đưa ra một giải thích khác: sự khác biệt không đến từ trọng số model khác nhau, mà từ môi trường hoạt động của Agent.
APY lý thuyết, lỗ là sự thật. Cộng đồng nhìn thấy ba 'model' nhưng thực chất là ba môi trường inference. Ngày 10 tháng 8, kho lưu trữ DeepSeek Harness chính thức cập nhật commit quan trọng: 'fix(preset): align minimal agent with RL composition'. Commit này nhằm đảm bảo Minimal Agent nhất quán với môi trường Agent được dùng trong huấn luyện reinforcement learning (RL). Tài liệu chính thức cho thấy preset Minimal bao gồm system prompt tối thiểu, môi trường Bash cố định, công cụ chỉnh sửa được chỉ định, và chính sách compaction dùng trong RL training, đồng thời loại bỏ identity prompt, web prompt, và tool description. Điều này gợi ý rằng DSH Minimal không phải là phiên bản 'rút gọn' của Standard, mà mô phỏng môi trường Agent thực tế mà model gặp trong quá trình huấn luyện.
Context: bối cảnh của DeepSeek-V4-Pro và Agent framework. DeepSeek-V4-Pro là model ngôn ngữ lớn thế hệ mới, được quảng bá với khả năng reasoning và tool use vượt trội. Agent framework của nó cho phép model tương tác với môi trường (Bash, trình duyệt, API) thông qua các công cụ. Cộng đồng thường so sánh hiệu suất trên các benchmark như DSH (DeepSeek Harness Standard). Khi một số người dùng gọi API và thấy kết quả khác nhau, họ nghi ngờ có nhiều model. Nhưng thực tế, DeepSeek Harness được thiết kế để kiểm tra Agent trong các điều kiện khác nhau: Standard (đầy đủ công cụ), PTC (Prompt Tool Combination), và Minimal (môi trường RL training). Các preset này thay đổi system prompt, bộ công cụ, và luồng thực thi.
Core: phân tích kỹ thuật từ mã nguồn và thử nghiệm cộng đồng. Các tester đã chạy cùng một model DeepSeek V4 Pro trên các môi trường Harness khác nhau và thu được kết quả: DSH Standard: 91 điểm; DSH PTC: 92 điểm; DSH Minimal: 99/96 điểm. Sự chênh lệch lên tới 8 điểm (từ 91 lên 99) là quá lớn nếu chỉ do nhiễu. Điều thú vị: khi tester phát triển plugin 'Anchored Standard', yêu cầu đầu tiên mô phỏng môi trường Minimal (chỉ mở shell và read tool), sau khi hoàn thành tool call đầu tiên thì khôi phục toàn bộ Standard toolset, kết quả liên tiếp đạt 98/99 điểm. Điều này chứng minh rằng: thứ tự và môi trường ngay từ đầu mới là yếu tố quyết định, không phải số lượng tool. Model không cần truy cập toàn bộ toolset ngay lập tức; nó chỉ cần được đặt vào đúng 'trạng thái tinh thần' mà nó đã được huấn luyện. Tester kết luận: chìa khóa hiệu suất Agent của V4 Pro không phụ thuộc vào cuối cùng nó có bao nhiêu tool, mà vào những gì model gặp đầu tiên: System Prompt + Tool Schema + Agent Scaffold.
Contrarian: góc nhìn phản trực giác. Cộng đồng tin rằng DeepSeek đang giấu nhiều model, nhưng thực tế có thể chỉ là một model duy nhất với cơ chế routing môi trường. Điều này trái ngược với suy nghĩ thông thường: 'nhiều kết quả khác nhau = nhiều model'. Thay vào đó, sự khác biệt đến từ lớp trừu tượng của Agent framework. Đây là một điểm mù: hầu hết người dùng chỉ tập trung vào trọng số model, nhưng bỏ qua ảnh hưởng của môi trường inference. Như trong DeFi, APY lý thuyết cao không có nghĩa là lợi nhuận thực tế; môi trường (gas, slippage, thanh khoản) mới quyết định. Tương tự, model AI có thể rất mạnh, nhưng nếu system prompt không khớp với cách nó được huấn luyện, hiệu suất sẽ giảm mạnh.
Takeaway: suy nghĩ tiến bộ. Vậy, 'ba model DeepSeek' thực chất là sự kết hợp của hai lớp yếu tố: một là sự khác biệt về môi trường API service, cấu hình deployment, hoặc gray instance; hai là liệu model có đi vào môi trường Agent gần với phân phối huấn luyện RL hay không. DeepSeek chưa chính thức xác nhận, nhưng bằng chứng từ mã nguồn và thử nghiệm cho thấy đây là lời giải thích hợp lý nhất. Vấn đề không phải 'có bao nhiêu model', mà là 'môi trường nào kích hoạt đúng khả năng của model'. Các nhà phát triển AI cần học bài học này: kiểm tra hiệu suất không chỉ trên một môi trường, mà cần hiểu môi trường đó tương tác với model như thế nào. Còn với người dùng cuối, hãy nhớ: hiệu suất lý thuyết chỉ là một phần; cách bạn gọi API mới là sự thật.
Từ góc nhìn của một người đã từng kiểm tra audit smart contract và tối ưu hóa yield farming, tôi thấy sự tương đồng rõ rệt. Khi tôi audit một protocol, tôi không chỉ nhìn vào code, mà còn xem nó chạy trong môi trường nào (mainnet, testnet, với token nào). Tương tự, khi bạn test DeepSeek-V4-Pro, đừng chỉ nhìn vào benchmark, hãy nhìn vào preset Harness. Dữ liệu từ cộng đồng cho thấy sự khác biệt lên tới 8 điểm chỉ vì thay đổi system prompt và toolset ban đầu. Đó là bài học về 'bối cảnh' mà mọi kỹ sư hệ thống nên khắc ghi.
Có audit rồi hãy nói chuyện yield. Ở đây, có hiểu môi trường rồi hãy nói chuyện hiệu suất. DeepSeek-V4-Pro không phải là ba model, mà là một model với ba bộ mặt khác nhau tùy vào cách bạn gọi nó. Điều này nhắc nhở chúng ta rằng trong AI, cũng như trong DeFi, lớp hạ tầng (infrastructure) thường bị đánh giá thấp. Hãy kiểm tra môi trường trước khi đổ lỗi cho model.
Tôi sẽ kết thúc bằng một câu hỏi: Liệu bạn có đang đánh giá một hệ thống dựa trên kết quả đầu ra mà không hiểu môi trường bên trong? Nếu bạn làm yield farming, bạn sẽ kiểm tra pool thanh khoản, audit, và lịch sử trước khi đầu tư. Tương tự, khi dùng AI, hãy kiểm tra môi trường inference. DeepSeek-V4-Pro không phải ngoại lệ. Đã đến lúc chúng ta ngừng nhìn vào model và bắt đầu nhìn vào system prompt.