← Trang chủ
Deep Dives

Dữ liệu tổng hợp cho AI an toàn: 1.000 ảnh có thể kém 750 ảnh

Một thí nghiệm computer vision mới của AWS cho thấy dữ liệu tổng hợp có thể cải thiện phát hiện người, nhưng thêm nhiều ảnh hơn không mặc nhiên tốt hơn và placement sai còn có thể làm kết quả giảm.

Một đội làm computer vision cho nhà máy có một vấn đề khó xử: họ cần ảnh người đứng ở những vị trí nguy hiểm gần máy móc để mô hình học cách phát hiện, nhưng lại không thể đưa người thật vào nguy hiểm chỉ để chụp dữ liệu. Dữ liệu tổng hợp nghe như lời giải tự nhiên. Kết quả AWS công bố ngày 17/9/2026 cho thấy hướng này có thể hữu ích — đồng thời cho thấy vì sao câu “cứ tạo thêm ảnh” là một quy tắc tệ.

Trong sweep của AWS, mô hình YOLO11-nano dùng dữ liệu thật có person mAP50 là 0,051. Khi bổ sung 250, 500 và 750 ảnh tổng hợp đặt người ở vị trí nguy hiểm phù hợp với bài toán, metric tăng lần lượt lên 0,069; 0,092; và 0,134. Nhưng khi tăng tiếp lên 1.000 ảnh, nó giảm còn 0,106. Nói cách khác, điểm tốt nhất trong thí nghiệm này nằm ở 750 ảnh chứ không phải lượng ảnh lớn nhất.

AWS giải thích rằng khi số ảnh tăng thêm, các lỗi sinh ảnh như khuôn mặt méo hoặc màu quá bão hòa có thể đưa nhiễu vào tập huấn luyện. Đây là kết quả của thí nghiệm cụ thể, không phải công thức rằng 750 luôn là con số đúng. Bài học có thể mang sang dự án khác là khối lượng dữ liệu tổng hợp cũng là một tham số phải đo, không phải mục tiêu cần tối đa hóa.

Placement thắng sự đa dạng trang trí

Một kết quả khác còn đáng chú ý hơn. AWS lấy ảnh thật có đầu máy nhưng không có người, rồi dùng Qwen-Image-Edit-2509 chèn người tổng hợp vào ảnh. Khi prompt yêu cầu người xuất hiện ở vị trí nguy hiểm có ý nghĩa với miền — trên đường ray, trên thiết bị hoặc trong đường di chuyển — person mAP50 tăng từ 0,051 lên 0,106 với 1.000 ảnh. Khi người chỉ được đặt ở hậu cảnh, metric còn giảm nhẹ xuống 0,046.

Thử thay đổi thời gian trong ngày và điều kiện môi trường cũng không tự động giúp. Trong bảng ablation của AWS, hazardous placement cộng scene variation đạt 0,088, thấp hơn hazardous placement đơn thuần 0,106. Điều đó không chứng minh scene variation là vô ích trong mọi dự án. Nó cho thấy một điều thực dụng hơn: dữ liệu tổng hợp phải tạo đúng tình huống mà mô hình cần học, chứ ảnh trông đa dạng hơn chưa chắc tạo thêm tín hiệu có ích.

Với một đội kỹ thuật, đây là chỗ nên đổi câu hỏi. Thay vì hỏi “chúng ta tạo được bao nhiêu ảnh?”, hãy hỏi “những lỗi nào trong dữ liệu thật đang thiếu ví dụ, và ảnh tổng hợp có đặt đúng vật thể vào các tình huống đó không?”

Điểm mạnh của phép thử: ảnh tổng hợp không đi vào test set

AWS dùng khoảng 3.200 ảnh OpenImages có tàu làm dữ liệu thật và thêm tối đa 1.000 ảnh tổng hợp cho training. Phần test chỉ dùng ảnh thật có locomotive. Cách tách này quan trọng: nếu đánh giá trên chính kiểu ảnh do generator tạo ra, một metric đẹp có thể chỉ cho thấy model đã quen với dấu vết của dữ liệu tổng hợp.

Giữ test set là dữ liệu thật làm kết quả dễ diễn giải hơn. Nhưng nó vẫn chưa biến thí nghiệm thành chứng nhận an toàn công nghiệp. AWS nói rõ OpenImages ở đây là một proxy có thể chia sẻ công khai cho dữ liệu thiết bị công nghiệp của khách hàng. Repository đi kèm cũng ghi đây là pipeline nghiên cứu/thử nghiệm, chưa phải phần mềm production-ready và cần review, harden trước khi áp dụng vào hệ thống thật.

Vì vậy, con số “cải thiện 160%” cần được đọc đúng phạm vi. Nó đến từ person mAP50 tăng từ 0,051 lên 0,134 ở điều kiện tốt nhất của sweep 750 ảnh. Đây là mức cải thiện tương đối trên tập thử và cấu hình mà AWS mô tả, không phải lời hứa rằng một camera an toàn ngoài hiện trường sẽ giảm 160% lỗi hay tai nạn.

Trước khi mang cách làm này sang dữ liệu của bạn

Một đội đang cân nhắc synthetic augmentation có thể lấy ba điều từ thí nghiệm này mà không cần sao chép nguyên stack AWS.

Thứ nhất, luôn giữ baseline chỉ dùng dữ liệu thật. Nếu không có baseline, bạn không biết synthetic data đang bổ sung tín hiệu hay chỉ làm pipeline phức tạp hơn.

Thứ hai, đánh giá trên tập ảnh thật tách biệt và nhìn cả metric gắn với failure quan trọng. Trong bài AWS, person recall thay đổi đáng kể giữa các kích cỡ YOLO; một metric tổng hợp duy nhất không kể hết câu chuyện. Với bài toán an toàn của riêng bạn, tập test còn phải đại diện cho camera, góc nhìn, ánh sáng, thiết bị, trang phục và tình huống thực tế mà hệ thống sẽ gặp.

Thứ ba, chạy sweep cho cả nội dung lẫn số lượng dữ liệu tổng hợp. AWS cho thấy hazardous placement giúp còn background placement có thể làm kém đi; 750 ảnh tốt hơn 1.000 trong một sweep. Hai kết quả này cùng chỉ về một nguyên tắc: generator không thay thế thiết kế thí nghiệm.

Có một ranh giới quan trọng nữa. Pipeline trong bài dùng Amazon Rekognition để tạo pseudo-label cho người được chèn vào ảnh. Tự động gắn nhãn giúp giảm công sức, nhưng trong hệ thống liên quan an toàn, đội triển khai vẫn cần quy trình kiểm chất lượng nhãn, kiểm các missed detections quan trọng và đánh giá trên dữ liệu hiện trường. Không nên để một chuỗi generator → auto-label → training tự trở thành bằng chứng rằng hệ thống đã đủ an toàn để vận hành.

Điều đáng giữ lại không phải con số 160%

Kết quả của AWS thú vị vì nó không kể câu chuyện “thêm dữ liệu là tốt hơn”. Chính bảng số liệu cho thấy ảnh được sinh sai vị trí có thể làm kết quả giảm và thêm từ 750 lên 1.000 ảnh cũng có thể làm metric đi xuống.

Nếu đang làm AI cho môi trường công nghiệp, cách dùng bài này hợp lý nhất là xem nó như một thiết kế thí nghiệm có thể kiểm tra: baseline thật, synthetic augmentation có mục tiêu, sweep lượng dữ liệu và test set thật. Sau đó phải lặp lại toàn bộ phép thử trên miền dữ liệu của mình. Với hệ thống liên quan đến con người và máy móc, synthetic data có thể giúp tạo ra những tình huống khó thu thập; nó không thay thế bằng chứng rằng mô hình hoạt động an toàn ở nơi sẽ được triển khai.

Nguồn

  • AWS Machine Learning Blog, 17/9/2026: mô tả dataset, pipeline Qwen-Image-Edit + Rekognition, các ablation về placement, số lượng ảnh tổng hợp, kích cỡ YOLO và các metric được nêu trong bài.
  • aws-samples/sample-synthetic-data-augmentation: mã mẫu và hướng dẫn tái lập pipeline; repository tự mô tả đây là research/experimentation pipeline, chưa production-ready.

Nguồn tham khảo

  1. aws.amazon.com
  2. GitHub