NghienCuuRobot.comNghiên Cứu Robot
Học tăng cường cho robot

An toàn khi robot học được hành vi

Chính sách học từ dữ liệu là hộp đen. Làm sao đảm bảo nó không làm điều nguy hiểm trong tình huống chưa từng gặp.

Nút dừng khẩn cấp màu đỏ trên bảng điều khiển

Bộ điều khiển viết tay có thể đọc và chứng minh giới hạn. Mạng nơ-ron với hàng triệu tham số thì không. Đây là rào cản thật khi đưa các phương pháp học vào hệ thống có thể gây hại.

Vì sao chính sách học khó đảm bảo

Không đọc được. Không có cách nào nhìn vào trọng số mạng và biết nó sẽ làm gì trong một tình huống cụ thể chưa thử.

Không gian trạng thái quá lớn để thử hết. Có thể thử hàng nghìn tình huống, nhưng số tình huống có thể xảy ra thì lớn hơn nhiều bậc.

Hành vi ngoài phân bố huấn luyện là không xác định. Gặp tình huống khác hẳn dữ liệu huấn luyện, mạng vẫn cho ra một hành động — nhưng hành động đó có thể tuỳ tiện. Và nó không báo rằng mình đang ở vùng lạ.

Thay đổi nhỏ ở đầu vào có thể đổi lớn ở đầu ra. Một thay đổi ánh sáng, một vệt bẩn trên ống kính có thể làm mạng cho ra hành động hoàn toàn khác.

Không có bảo đảm toán học. Bộ điều khiển cổ điển chứng minh được tính ổn định trong một miền. Với mạng nơ-ron, các phương pháp chứng minh còn rất hạn chế về quy mô.

Hệ quả thực tế: không thể dựa vào chính sách học để đảm bảo an toàn. Phải có lớp khác lo việc đó.

Bộ lọc an toàn ở tầng dưới

Giải pháp thực dụng nhất và được dùng rộng rãi nhất.

Nguyên tắc. Chính sách học đề xuất hành động; một tầng kiểm tra đơn giản viết tay có quyền phủ quyết hoặc sửa hành động đó trước khi tới động cơ.

Các kiểm tra điển hình. Giới hạn tốc độ và gia tốc. Giới hạn góc khớp. Giới hạn lực và mô-men. Vùng không gian cấm. Khoảng cách tối thiểu tới người phát hiện được.

Vì sao hiệu quả. Tầng này đơn giản đủ để đọc, kiểm chứng và chứng minh. Chính sách học có thể làm bất cứ điều gì trong ranh giới đó nhưng không vượt ra ngoài.

Điều nó không làm được. Không ngăn được hành vi nguy hiểm nằm trong giới hạn — robot vẫn có thể đập vỡ vật khi ở trong giới hạn lực cho phép.

Nguyên tắc thiết kế. Tầng an toàn phải độc lập hoàn toàn với chính sách — mã riêng, tốt nhất là bộ xử lý riêng. Cùng phần mềm thì một lỗi có thể vô hiệu hoá cả hai.

Đây là lý do các hệ thống thương mại vẫn giữ bộ điều khiển truyền thống dù có dùng học máy ở tầng trên.

Phát hiện tình huống lạ

Hướng bổ sung quan trọng và còn nhiều chỗ chưa tốt.

Mục tiêu. Robot nhận ra mình đang ở tình huống khác với dữ liệu huấn luyện, rồi hành xử thận trọng hoặc dừng lại thay vì đưa ra hành động tuỳ tiện.

Cách đo — độ không chắc chắn của mô hình. Một số kiến trúc cho ra ước lượng độ tin cậy kèm dự đoán. Hữu ích nhưng các mạng thường tự tin quá mức, kể cả khi sai.

Cách đo — nhiều mô hình cùng dự đoán. Huấn luyện vài mô hình, xem chúng có đồng ý không. Bất đồng là dấu hiệu vùng lạ. Hiệu quả nhưng tốn tính toán.

Cách đo — so với phân bố dữ liệu huấn luyện. Đo trực tiếp xem quan sát hiện tại có giống dữ liệu đã học không.

Làm gì khi phát hiện. Giảm tốc, chuyển sang bộ điều khiển dự phòng đơn giản, dừng an toàn, hoặc gọi người. Có sẵn phương án leo thang quan trọng hơn là phát hiện chính xác.

Thực trạng. Đây vẫn là điểm yếu. Các phương pháp hiện có bắt được tình huống rất khác, nhưng bỏ sót tình huống hơi khác — mà tình huống hơi khác mới là loại thường gặp.

An toàn trong lúc huấn luyện

Bài toán riêng, khác với an toàn khi vận hành.

Vấn đề. Giai đoạn khám phá đòi hỏi thử hành động ngẫu nhiên. Trên robot thật, đó là công thức làm hỏng máy hoặc gây thương tích.

Cách một — huấn luyện trong mô phỏng. Cách phổ biến nhất và giải quyết được vấn đề, đổi lại là khoảng cách mô phỏng thực tế.

Cách hai — giới hạn không gian hành động khi khám phá. Chỉ cho phép thử trong dải hẹp quanh hành vi đã biết là an toàn, nới dần khi tin cậy tăng.

Cách ba — bộ điều khiển bảo hộ. Một bộ điều khiển đơn giản luôn sẵn sàng tiếp quản khi trạng thái tiến gần vùng nguy hiểm. Chính sách học tự do trong vùng an toàn, bị can thiệp ở biên.

Cách bốn — môi trường vật lý an toàn. Huấn luyện với vật nhẹ, tốc độ thấp, có rào chắn, không có người trong vùng. Thô sơ nhưng hiệu quả.

Chi tiết thường bị bỏ qua. Đặt lại hiện trường tự động. Nếu mỗi lần thất bại cần người can thiệp thì huấn luyện trên máy thật không mở rộng được, và đây là lý do thực tế nhất khiến nhiều dự án dừng ở mô phỏng.

Đưa vào vận hành có trách nhiệm

Nguyên tắc cho người triển khai hệ thống có thành phần học được.

Bắt đầu ở nơi hậu quả sai lầm nhỏ. Vật nhẹ, không có người xung quanh, quy trình có thể làm lại. Đừng bắt đầu ở khâu quan trọng nhất.

Luôn có đường lùi. Khi chính sách học không tự tin hoặc phát hiện bất thường, chuyển sang phương pháp cũ hoặc gọi người. Đường lùi phải được thử thật, không chỉ tồn tại trong thiết kế.

Ghi lại đầy đủ. Mọi tình huống bất thường phải có dữ liệu để phân tích. Đây cũng là nguồn dữ liệu huấn luyện tốt nhất.

Giám sát chỉ số theo thời gian. Tỷ lệ thành công giảm dần là dấu hiệu môi trường đã trôi khỏi điều kiện huấn luyện. Không theo dõi thì phát hiện quá muộn.

Đừng mở rộng phạm vi âm thầm. Hệ thống chạy tốt với ba loại vật thể không có nghĩa là chạy tốt với loại thứ tư. Mỗi mở rộng phải kiểm lại.

Nói rõ giới hạn với người vận hành. Họ cần biết hệ thống làm được gì và khi nào không tin được. Giấu giới hạn đi là cách chắc chắn để có sự cố, vì người vận hành sẽ dùng nó ngoài phạm vi mà không biết.

Câu hỏi thường gặp

Vì sao không thể đảm bảo an toàn bằng chính chính sách học?

Vì không đọc được mạng để biết nó làm gì trong tình huống chưa thử, không gian trạng thái quá lớn để thử hết, và hành vi ngoài phân bố huấn luyện là không xác định.

Bộ lọc an toàn ở tầng dưới hoạt động thế nào?

Chính sách học đề xuất hành động, một tầng kiểm tra đơn giản viết tay phủ quyết hoặc sửa trước khi tới động cơ — giới hạn tốc độ, góc khớp, lực và vùng cấm. Tầng này phải độc lập hoàn toàn.

Vì sao phát hiện tình huống lạ vẫn là điểm yếu?

Vì các phương pháp hiện có bắt được tình huống rất khác nhưng bỏ sót tình huống hơi khác — mà tình huống hơi khác mới là loại thường gặp trong vận hành.

Nguyên tắc đưa vào vận hành có trách nhiệm?

Bắt đầu ở nơi hậu quả sai lầm nhỏ, luôn có đường lùi đã được thử thật, ghi lại mọi bất thường, giám sát tỷ lệ thành công theo thời gian và nói rõ giới hạn với người vận hành.

Đọc thêm trong Điều khiển & lý thuyếtBenchmark & tập dữ liệu.

Cần tư vấn cụ thể cho trường hợp của bạn?

Chúng tôi sẽ liên hệ trong vòng 24 giờ.

Đăng ký tư vấn ngay

Bài viết liên quan

Bạn cần hỗ trợ thêm?

Để lại thông tin, chúng tôi sẽ liên hệ trong 24 giờ.

hoặc
Gọi ngay 0926 138 138