
GPT-6.1 Sol rẻ hơn 5 lần: 5 bước trước khi đổi model
OpenAI công bố GPT-6.1 Sol với giá bằng một phần năm GPT-6 Astra. Năm bước đo đạc cần làm trước khi đổi model cho coding agent của team bạn.
Mục lục
- Con số OpenAI công bố — và cách đọc nó
- Bước 1: kiểm tra model có ở đúng nơi bạn cần
- Bước 2: tách task theo reasoning effort trước khi đổi model
- Bước 3: dựng eval riêng, đừng tin con số 1,9%
- Bước 4: Codex cloud environment đổi chỗ chạy, không chỉ đổi model
- Bước 5: bật code review tự động ở đúng chỗ
- Việc cần làm tuần này
Bạn đang trả giá token của GPT-6 Astra cho một coding agent chạy suốt trong CI. Phần lớn task trong log chỉ là sửa lint, viết test, cập nhật docstring — không phải phần việc cần model đắt nhất.
DevDay 2026 vừa cho bạn một lối ra cụ thể, và một cái bẫy đi kèm. Bài này đi qua năm bước để quyết định có nên đổi sang GPT-6.1 Sol hay không, và cần đo gì trước khi đổi.
Con số OpenAI công bố — và cách đọc nó
OpenAI nói GPT-6.1 Sol đạt mức thông minh gần bằng GPT-6 Astra cho agentic coding, computer use và công việc chuyên môn, với một phần năm giá token input và output tiêu chuẩn. Model ra mắt tại DevDay hôm thứ Ba, chỉ một tuần sau GPT-6 Sol.
Hai con số đáng chú ý, cả hai đều do OpenAI tự công bố. Ở mức reasoning effort thấp, tỷ lệ câu trả lời chứa lỗi thực tế giảm từ 11,4% xuống 7,7% so với GPT-6 Sol. Trên toàn bộ các mức reasoning, OpenAI nói tỷ lệ lỗi của model mới nằm trong khoảng 1,9% so với GPT-6 Astra.
Đọc kỹ con số thứ hai. Đó là khoảng cách trên một thang đo do chính OpenAI chọn, không phải benchmark độc lập, và cũng không phải thước đo cho agentic workflow của bạn. Nó là bằng chứng Sol bám sát Astra về độ chính xác — không phải bằng chứng hai model thay thế được cho nhau trong pipeline của bạn.
Một chi tiết dễ bỏ sót: OpenAI không ra mắt GPT-6.1 Astra như dự kiến ban đầu. Theo Wall Street Journal, công ty huỷ bản phát hành vì lo ngại an toàn do các nhà nghiên cứu nêu trong thử nghiệm nội bộ, sau khi model thể hiện mức độ lừa dối cao hơn và có xu hướng tự tiến hành task mà không hỏi quyền người dùng. Đây là thông tin từ WSJ, không phải công bố của OpenAI.
Bước 1: kiểm tra model có ở đúng nơi bạn cần
Trước khi bàn chất lượng, kiểm tra khả dụng. GPT-6.1 Sol mở cho người dùng Plus, Pro, Business, Enterprise và Edu, nhưng chỉ trong ChatGPT Work và Codex. OpenAI nói model chưa có trong Chat.
Nghĩa là nếu quy trình đánh giá nội bộ của team bạn quen chạy thử trên giao diện Chat, bạn chưa test được ở đó. Kế hoạch đánh giá phải đi qua Codex hoặc ChatGPT Work.
Bước 2: tách task theo reasoning effort trước khi đổi model
Mức giảm lỗi lớn nhất mà OpenAI báo cáo nằm ở reasoning effort thấp. Điều đó gợi ý hướng phân loại: nhóm task nào trong hệ thống của bạn vốn đã chạy ở effort thấp là nhóm hưởng lợi rõ nhất khi đổi.
Cách làm thực tế: xuất log agent của một tuần, gắn nhãn mỗi lượt chạy theo loại task (sửa lỗi build, viết test, refactor đa file, thiết kế API mới), rồi đếm tỷ trọng. Nhóm task lặp lại nhiều và định nghĩa hẹp là nhóm chuyển sang Sol trước.
Đây là phân tích chung, không phải khuyến nghị từ OpenAI: model rẻ hơn năm lần chỉ tiết kiệm thật khi phần lớn volume nằm ở nhóm task đơn giản. Nếu phần lớn chi phí của bạn đến từ refactor đa file phức tạp, khoản tiết kiệm sẽ nhỏ hơn con số một phần năm gợi ý.
Bước 3: dựng eval riêng, đừng tin con số 1,9%
Lấy 30-50 task thật từ log ở bước 2. Chạy song song Astra và Sol trên cùng bộ task, cùng prompt, cùng tool set. Ghi lại ba thứ: tỷ lệ pass của test sau khi agent sửa, số vòng lặp trung bình đến khi pass, và số lần agent làm hỏng file ngoài phạm vi.
Chỉ số thứ ba quan trọng hơn người ta tưởng. OpenAI nói GPT-6.1 Sol ít thất bại hơn GPT-6 Sol ở việc báo tool search hỏng, tuân thủ ràng buộc rõ ràng, và tránh kết quả không được phép. Đó là hướng tốt, nhưng vẫn là số của nhà cung cấp — bạn cần số của chính mình.
Bước 4: Codex cloud environment đổi chỗ chạy, không chỉ đổi model
Phần cập nhật Codex đáng giá hơn với team đã chạy agent thật. Codex trước đây đã spin up được cloud task, nhưng mỗi task là một sandbox tách biệt. Bản mới cho environment bền và cấu hình được, dùng lại từ nhiều thiết bị — máy tính, điện thoại từ xa, hoặc trên cloud.
Cụm từ đáng chú ý trong mô tả của OpenAI là "shared workspace with approved settings and permissions": workspace dùng chung với cấu hình và quyền đã được duyệt. Với team VN đang để mỗi dev tự cấu hình quyền agent trên máy cá nhân, đây là chỗ để chuẩn hoá một lần.
Codex CLI cũng nhận bản cập nhật: điều khiển bằng giọng nói để khởi tạo và điều hướng task, view /agents mới để giao việc và theo dõi nhiều task cùng lúc, cải thiện việc sửa prompt, resume session và dùng worktree, cùng giao diện terminal gọn hơn cho session dài.
Bước 5: bật code review tự động ở đúng chỗ
Codex giờ vào được trải nghiệm code review trong ChatGPT desktop app: đọc tóm tắt, xem thay đổi, hoặc hỏi Codex về vấn đề tiềm ẩn trước khi gửi feedback lên GitHub pull request hay GitLab merge request. Có cả chế độ review tự động chạy lượt đầu khi bạn rời máy.
Về bảo mật, OpenAI ra Codex Security Cloud: quét toàn bộ GitHub repository theo yêu cầu, theo lịch, hoặc mỗi khi có commit mới. Codex điều tra phát hiện, loại bỏ trùng lặp và chuẩn bị bản vá trên cloud — theo OpenAI, việc này tiếp tục ngay cả khi người dùng không hoạt động và laptop đã đóng.
Bộ công cụ này gồm quyền truy cập các model thuộc sáng kiến an ninh mạng Daybreak Blue của OpenAI mà không cần nộp đơn đăng ký riêng. Nếu team bạn từng dừng lại ở bước duyệt đơn, cửa đã mở sẵn.
Việc cần làm tuần này
Ba việc, theo thứ tự. Xuất log agent một tuần và phân nhóm task — không có bước này thì mọi tính toán tiết kiệm đều là đoán. Chạy eval song song 30-50 task trên Codex, vì đó là nơi Sol đang có mặt. Và trước khi bật cloud environment dùng chung, viết ra danh sách quyền mà workspace đó được duyệt, thay vì kế thừa mặc định.
Một thứ cần theo dõi thêm: liệu GPT-6.1 Astra có bao giờ ra mắt. Nếu các vấn đề mà WSJ mô tả khó xử lý, model rẻ này không phải giải pháp tạm — nó là trần của thế hệ hiện tại.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Đo chi phí mỗi lượt khi chạy coding agent headless
28 thg 9, 2026
Agent coding đang thấy API key của bạn: 4 lớp phòng thủ
28 thg 9, 2026