Khi mô hình Machine Learning hoặc ứng dụng dùng mô hình ngôn ngữ lớn cho kết quả chưa tốt, phản xạ quen thuộc là tăng dữ liệu, đổi thuật toán, thử mô hình lớn hơn hoặc tinh chỉnh thêm tham số. Những việc này đôi khi cần thiết, nhưng nếu làm quá sớm thì rất dễ tốn công mà không biết mình đang sửa vấn đề gì. Một bước đơn giản hơn, rẻ hơn và thường hiệu quả hơn là phân tích lỗi mô hình. Phân tích lỗi là quá trình xem lại có hệ thống các trường hợp mô hình dự đoán sai, trả lời kém hoặc không ổn định, từ đó tìm ra nhóm nguyên nhân chính. Mục tiêu không phải là bắt lỗi từng dòng một, mà là hiểu mô hình đang yếu ở đâu để ưu tiên cải thiện đúng chỗ. Ví dụ, bạn xây dựng mô hình phân loại phản hồi khách hàng thành các nhóm: khiếu nại, góp ý, hỏi thông tin và khen ngợi. Độ chính xác tổng thể đạt mức chấp nhận được, nhưng khi đưa vào dùng thật, đội chăm sóc khách hàng vẫn phải sửa nhiều. Nếu chỉ nhìn một con số accuracy, bạn khó biết vấn đề nằm ở đâu. Nhưng khi lấy 100 đến 200 mẫu dự đoán sai ra xem, có thể bạn phát hiện: - Mô hình hay nhầm giữa “góp ý” và “khiếu nại” khi câu có giọng nhẹ nhàng. - Các phản hồi viết tắt hoặc sai chính tả bị phân loại sai nhiều hơn. - Những câu có nhiều ý cùng lúc, ví dụ vừa hỏi thông tin vừa phàn nàn, làm mô hình lúng túng. - Một số nhãn trong dữ liệu huấn luyện được gán không nhất quán. Từ các phát hiện này, hướng cải thiện sẽ rõ hơn nhiều. Thay vì lập tức đổi mô hình, bạn có thể chuẩn hóa lại quy tắc gán nhãn, bổ sung dữ liệu cho nhóm dễ nhầm, thêm tiền xử lý lỗi chính tả hoặc cho phép một phản hồi có nhiều nhãn nếu bài toán thực tế cần như vậy. Một cách làm thực tế là tạo bảng phân tích lỗi với các cột: nội dung đầu vào, nhãn đúng, dự đoán của mô hình, mức độ tự tin nếu có, loại lỗi, ghi chú nguyên nhân và hướng xử lý đề xuất. Ban đầu không cần công cụ phức tạp; một file bảng tính cũng đủ. Điều quan trọng là phải phân loại lỗi thành các nhóm có ý nghĩa, chẳng hạn: dữ liệu thiếu, nhãn sai, đầu vào mơ hồ, lỗi tiền xử lý, mô hình thiếu ngữ cảnh, hoặc yêu cầu sản phẩm chưa rõ. Với ứng dụng dùng mô hình ngôn ngữ lớn, phân tích lỗi cũng rất cần thiết. Chẳng hạn một chatbot nội bộ trả lời sai có thể do nhiều nguyên nhân khác nhau: tài liệu truy xuất không liên quan, prompt hướng dẫn chưa rõ, mô hình suy diễn quá đà, câu hỏi người dùng thiếu thông tin, hoặc dữ liệu nguồn đã lỗi thời. Nếu gộp tất cả thành “LLM trả lời sai” thì rất khó sửa. Nhưng nếu tách lỗi theo từng khâu, bạn sẽ biết nên cải thiện bộ truy xuất, viết lại prompt, thêm cơ chế yêu cầu người dùng làm rõ, hay bổ sung kiểm tra trước khi trả lời. Một vài lời khuyên có thể áp dụng ngay: - Đừng chỉ xem các chỉ số trung bình. Hãy xem mẫu sai cụ thể, nhất là các lỗi ảnh hưởng lớn đến người dùng. - Lấy mẫu lỗi theo từng nhóm dữ liệu quan trọng, ví dụ khách hàng mới/cũ, văn bản ngắn/dài, tiếng Việt có dấu/không dấu. - Ghi lại giả thuyết trước khi sửa. Ví dụ: “mô hình sai nhiều vì thiếu dữ liệu câu viết tắt”. Sau đó kiểm chứng bằng thử nghiệm nhỏ. - Ưu tiên lỗi theo tác động thực tế, không chỉ theo số lượng. Một lỗi ít gặp nhưng gây quyết định sai nghiêm trọng vẫn cần xử lý sớm. - Sau mỗi lần cải thiện, dùng lại một bộ kiểm thử cố định để xem có thật sự tốt hơn không, tránh sửa chỗ này nhưng làm hỏng chỗ khác. Phân tích lỗi không hào nhoáng như huấn luyện mô hình lớn hay tích hợp công nghệ mới, nhưng nó là kỹ năng rất đáng rèn trong các dự án AI thực tế. Một mô hình tốt không chỉ đến từ thuật toán mạnh, mà còn từ việc hiểu rõ dữ liệu, hiểu rõ bối cảnh sử dụng và biết sửa đúng vấn đề đang tồn tại.