Prompt engineering hay fine-tune: đọc tín hiệu nào trước
Eval phẳng qua 3-4 lần sửa, task hẹp, vài nghìn labelled run — bộ tín hiệu để biết khi nào prompting hết đường và khi nào fine-tune mới đáng.
System prompt của bạn phình ra từng tuần, và mỗi lần sửa một failure mode thì mọc ra một cái khác. Có người trong team bắt đầu nói tới chuyện fine-tune, và không ai chắc đó là bước đúng hay chỉ là bước đắt.
Một bài phân tích trên Dev.to đưa ra bộ tín hiệu để đọc trước khi bạn đốt một sprint tìm câu trả lời bằng cách thử.
Hai kỹ thuật, hai thứ bị đổi
Bài chốt phần định nghĩa rất gọn: "Prompting changes what you say to the model. Fine-tuning changes the model itself." Từ đó, bảng so sánh của bài:
| Tiêu chí | Prompt engineering | Fine-tuning |
|---|---|---|
| Thứ bị đổi | The input | The model's weights |
| Nằm ở đâu | The context window | The model |
| Chi phí | Seconds, no infrastructure | GPU time and a training pipeline |
| Dữ liệu cần | None, or a handful of examples | Thousands of labelled runs |
| Khả năng lùi lại | Instant | Only by retraining |
| Sống sót khi đổi model | Yes | No |
| Giới hạn trên | Plateaus quickly | High, bounded by data quality |
Dòng "Survives a model swap" là dòng dev VN nên đọc kỹ nhất. Nếu bạn đang đổi model vài tháng một lần để bám giá, một model đã fine-tune sẽ không đi theo bạn qua lần đổi đó.
Tín hiệu: eval phẳng bao nhiêu lần thì đủ
Bài mô tả đây là một vòng lặp, không phải quyết định một lần: "You stay in prompt-engineering mode until the eval curve goes flat, then check whether you actually have what fine-tuning needs, a narrow task and real data."
Ngưỡng cụ thể trong bảng của bài: eval phẳng qua 3-4 lần sửa, task hẹp, và "a few thousand labelled runs in hand" thì mới tới bước fine-tune. Nếu eval phẳng nhưng task còn rộng hoặc chưa có label, bài nói việc cần làm là "Build the dataset first" — không phải train.
Bốn triệu chứng prompting hết đường
Bài liệt kê chúng theo đúng thứ tự thường xuất hiện:
- The plateau — "Each prompt tweak moves the eval less."
- Whack-a-mole — "The instruction that fixes today's failure mode causes tomorrow's."
- Prompt bloat — "The system prompt keeps growing, slows the model down, and gets partially ignored."
- Paying rent — "You're re-sending the same correction on every single call."
Điểm đắt nhất, theo bài, không phải hóa đơn token: "Engineering hours are the priciest line item in most LLM pipelines, and it's easy to burn a month nudging a prompt that plateaued weeks ago."
Ba điều kiện trước khi train
Bài đặt ba điều kiện, và điều kiện thứ hai là chỗ phần lớn đội sẽ dừng lại: "A few thousand labelled runs, ideally sampled from production traffic rather than synthetic examples." Điều kiện một là task hẹp — "Fine-tuning sharpens a model on one job, not general capability".
Điều kiện ba là lý do kinh tế, và ở đây cần đọc kèm bối cảnh: bài được đăng bởi Overmind, một nền tảng huấn luyện model, nên đây là claim của nhà cung cấp chứ không phải số đo độc lập. Bài viết rằng "a smaller, fine-tuned model can outperform a much larger general-purpose one carrying a bloated prompt, at a fraction of the inference cost". Không có con số kèm theo, nên hãy coi đó là giả thuyết cần bạn tự đo.
Việc làm trước
Dựng eval có điểm số trước khi bàn tiếp. Không có đường cong eval thì "phẳng qua 3-4 lần sửa" chỉ là cảm giác, và bạn sẽ không biết mình đang ở đâu trong vòng lặp trên. Song song, bắt đầu lưu trace production ngay từ bây giờ — vì nếu quyết định fine-tune có tới, thứ chặn bạn sẽ là dataset, không phải GPU.
Không spam, hủy đăng ký bất kỳ lúc nào.
