Bỏ qua để vào nội dung chính

Prompt engineering hay fine-tune: đọc tín hiệu nào trước

Bởi Henry Morgan
08 thg 9, 20264 phút đọc

Eval phẳng qua 3-4 lần sửa, task hẹp, vài nghìn labelled run — bộ tín hiệu để biết khi nào prompting hết đường và khi nào fine-tune mới đáng.

System prompt của bạn phình ra từng tuần, và mỗi lần sửa một failure mode thì mọc ra một cái khác. Có người trong team bắt đầu nói tới chuyện fine-tune, và không ai chắc đó là bước đúng hay chỉ là bước đắt.

Một bài phân tích trên Dev.to đưa ra bộ tín hiệu để đọc trước khi bạn đốt một sprint tìm câu trả lời bằng cách thử.

Hai kỹ thuật, hai thứ bị đổi

Bài chốt phần định nghĩa rất gọn: "Prompting changes what you say to the model. Fine-tuning changes the model itself." Từ đó, bảng so sánh của bài:

Tiêu chíPrompt engineeringFine-tuning
Thứ bị đổiThe inputThe model's weights
Nằm ở đâuThe context windowThe model
Chi phíSeconds, no infrastructureGPU time and a training pipeline
Dữ liệu cầnNone, or a handful of examplesThousands of labelled runs
Khả năng lùi lạiInstantOnly by retraining
Sống sót khi đổi modelYesNo
Giới hạn trênPlateaus quicklyHigh, bounded by data quality

Dòng "Survives a model swap" là dòng dev VN nên đọc kỹ nhất. Nếu bạn đang đổi model vài tháng một lần để bám giá, một model đã fine-tune sẽ không đi theo bạn qua lần đổi đó.

Tín hiệu: eval phẳng bao nhiêu lần thì đủ

Bài mô tả đây là một vòng lặp, không phải quyết định một lần: "You stay in prompt-engineering mode until the eval curve goes flat, then check whether you actually have what fine-tuning needs, a narrow task and real data."

Ngưỡng cụ thể trong bảng của bài: eval phẳng qua 3-4 lần sửa, task hẹp, và "a few thousand labelled runs in hand" thì mới tới bước fine-tune. Nếu eval phẳng nhưng task còn rộng hoặc chưa có label, bài nói việc cần làm là "Build the dataset first" — không phải train.

Bốn triệu chứng prompting hết đường

Bài liệt kê chúng theo đúng thứ tự thường xuất hiện:

  • The plateau — "Each prompt tweak moves the eval less."
  • Whack-a-mole — "The instruction that fixes today's failure mode causes tomorrow's."
  • Prompt bloat — "The system prompt keeps growing, slows the model down, and gets partially ignored."
  • Paying rent — "You're re-sending the same correction on every single call."

Điểm đắt nhất, theo bài, không phải hóa đơn token: "Engineering hours are the priciest line item in most LLM pipelines, and it's easy to burn a month nudging a prompt that plateaued weeks ago."

Ba điều kiện trước khi train

Bài đặt ba điều kiện, và điều kiện thứ hai là chỗ phần lớn đội sẽ dừng lại: "A few thousand labelled runs, ideally sampled from production traffic rather than synthetic examples." Điều kiện một là task hẹp — "Fine-tuning sharpens a model on one job, not general capability".

Điều kiện ba là lý do kinh tế, và ở đây cần đọc kèm bối cảnh: bài được đăng bởi Overmind, một nền tảng huấn luyện model, nên đây là claim của nhà cung cấp chứ không phải số đo độc lập. Bài viết rằng "a smaller, fine-tuned model can outperform a much larger general-purpose one carrying a bloated prompt, at a fraction of the inference cost". Không có con số kèm theo, nên hãy coi đó là giả thuyết cần bạn tự đo.

Việc làm trước

Dựng eval có điểm số trước khi bàn tiếp. Không có đường cong eval thì "phẳng qua 3-4 lần sửa" chỉ là cảm giác, và bạn sẽ không biết mình đang ở đâu trong vòng lặp trên. Song song, bắt đầu lưu trace production ngay từ bây giờ — vì nếu quyết định fine-tune có tới, thứ chặn bạn sẽ là dataset, không phải GPU.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan