MUMBAI, India, July 24 -- Intellectual Property India has published a patent application (202611060030 A) filed by Laith H. Alzubaidi; and Dr. Rohit Sharma on May 12, 2026, for System And Method For Reinforcement Learning-Based Decision Optimization Using Reward Shaping And Policy Adaptation.
Inventors include Laith H. Alzubaidi; and Dr. Rohit Sharma.
The application for the patent was published on July 17, 2026, under issue no. 29/2026.
Abstract: The present disclosure relates to a system and method for reinforcement learning-based decision optimization using reward shaping and policy adaptation. The system comprises a sensing unit configured to acquire operational state parameters from a physical machine or monitored structure, a signal conditioning unit configured to process acquired environmental signals, a state processing processor configured to generate multidimensional state vectors, and a reinforcement learning processor configured to generate optimized operational actions according to sequential state transitions and cumulative reward evaluation. The system further comprises a reward shaping processor configured to dynamically generate intermediate rewards and terminal rewards based on operational efficiency, energy utilization, safety conditions, throughput characteristics, and machine stability parameters. A policy adaptation processor continuously modifies action selection policies according to environmental uncertainty conditions, reward progression trends, and historical operational experiences stored within a memory unit.
Disclaimer: Curated by HT Syndication.