NGHIÊN CỨU, THIẾT KẾ BỘ ĐIỀU KHIỂN CÁNH TAY ROBOT 6 BẬC TỰ DO DỰA TRÊN PHƯƠNG PHÁP HỌC TĂNG CƯỜNG MỀM ACTOR-CRITIC
Tóm tắt
Điều khiển chính xác cánh tay robot trong môi trường động, bất định là thách thức lớn đối với các bộ điều khiển kinh điển và các phương pháp hiện đại như điều khiển thích nghi hay điều khiển tối ưu. Mặc dù học tăng cường sâu (DRL) đã mở ra hướng đi mới, nhưng vẫn bộc lộ hạn chế về tính hội tụ cục bộ và thiếu sự cân bằng trong chiến lược khám phá không gian. Để giải quyết triệt để vấn đề này, bài báo đề xuất một bộ điều khiển tiên tiến cho cánh tay robot 6 bậc tự do (6DOF) dựa trên phương pháp học tăng cường mềm Actor-Critic (Soft Actor-Critic - SAC). Trong nghiên cứu này, hệ thống trạng thái trước tiên được thiết lập các phương trình động học, động lực học và mô hình hóa dưới dạng quá trình quyết định Markov (MDP). Không gian trạng thái, hàm phần thưởng đa mục tiêu và cấu trúc mạng nơ-ron Actor-Critic được thiết kế nhằm tối đa hóa phần thưởng tích lũy kết hợp với cực đại hóa entropy. Cơ chế này giúp robot khám phá môi trường hiệu quả, tránh rơi vào các điểm tối ưu cục bộ và bám quỹ đạo trơn tru. Để kiểm chứng, bộ điều khiển được áp dụng vào bài toán thực nghiệm động lực học phức tạp: điều khiển robot dự đoán và đánh trúng quả bóng bàn với các quỹ đạo rơi ngẫu nhiên. Kết quả kỳ vọng cho thấy thuật toán SAC vượt trội về tốc độ hội tụ, độ ổn định và khả năng phản xạ theo thời gian thực, khẳng định tiềm năng to lớn trong việc giải quyết các tác vụ đa nhiệm phức tạp.
Từ khóa:
Cánh tay robot; Mô hình học tăng cường, Điều khiển dự đoán; Phương pháp học tăng cường mềm Actor-Critic (SAC)Title
RESEARCH AND DESIGN OF 6-DOF ROBOT ARM CONTROLLER BASED ON SOFT ACTOR-CRITIC REINFORCEMENT LEARNING METHODAbstract
Precisely controlling a robotic arm in a dynamic, uncertain environment is a major challenge for classical controllers and modern methods such as adaptive or optimal control. Although deep reinforcement learning (DRL) has opened new avenues, but still exhibited limitations in local convergence and a lack of balance in spatial exploration strategies. To thoroughly address this problem, this paper proposes an advanced controller for a 6-DOF robotic arm based on the Soft Actor-Critic (SAC) reinforcement learning method. In this study, the state system is first established with kinematic and dynamic equations and modeled as a Markov decision process (MDP). The state space, multi-objective reward function, and Actor-Critic neural network structure are designed to maximize cumulative reward combined with maximizing entropy. This mechanism helps the robot explore its environment efficiently, avoiding local optimal points and maintaining a smooth trajectory. To verify this, the controller was applied to a complex dynamics experiment: controlling the robot to predict and hit a table tennis ball with random falling trajectories. The expected results showed that the SAC algorithm excelled in convergence speed, stability, and real-time responsiveness, confirming its enormous potential in solving complex multitasking problems.
