-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathmappo_learner.py
More file actions
137 lines (118 loc) · 5.27 KB
/
Copy pathmappo_learner.py
File metadata and controls
137 lines (118 loc) · 5.27 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
"""MAPPO learner with a centralised state-value critic."""
import copy
import torch
from torch.optim import Adam
from components.episode_buffer import EpisodeBatch
from modules.critics import REGISTRY as critic_registry
from utils.rl_utils import build_td_lambda_targets
class MAPPOLearner:
def __init__(self, mac, scheme, logger, args):
self.args = args
self.n_agents = args.n_agents
self.mac = mac
self.logger = logger
self.agent_params = list(mac.parameters())
self.agent_optimiser = Adam(self.agent_params, lr=args.lr)
self.critic = critic_registry[args.critic_type](scheme, args)
self.target_critic = copy.deepcopy(self.critic)
self.critic_params = list(self.critic.parameters())
self.critic_optimiser = Adam(self.critic_params, lr=args.critic_lr)
self.last_target_update_step = 0
self.critic_training_steps = 0
self.log_stats_t = -args.learner_log_interval - 1
def _policy_outputs(self, batch):
self.mac.init_hidden(batch.batch_size)
return torch.stack(
[self.mac.forward(batch, t=t) for t in range(batch.max_seq_length - 1)],
dim=1,
)
def train(self, batch: EpisodeBatch, t_env: int, episode_num: int):
del episode_num
rewards = batch["reward"][:, :-1].squeeze(-1)
actions = batch["actions"][:, :-1]
mask = batch["filled"][:, :-1].float().squeeze(-1)
terminated = batch["terminated"][:, :-1].float().squeeze(-1)
mask[:, 1:] *= 1 - terminated[:, :-1]
agent_mask = mask.unsqueeze(-1).expand(-1, -1, self.n_agents)
old_policy = self._policy_outputs(batch)
old_log_prob = torch.log(
torch.gather(old_policy, dim=3, index=actions).squeeze(3) + 1e-10
)
states = batch["state"]
target_values = self.target_critic(states).squeeze(-1)
targets = build_td_lambda_targets(
rewards,
terminated,
mask,
target_values,
1,
self.args.gamma,
self.args.td_lambda,
)
values = self.critic(states)[:, :-1].squeeze(-1)
td_error = targets.detach() - values
critic_loss = (td_error.square() * mask).sum() / mask.sum()
self.critic_optimiser.zero_grad()
critic_loss.backward()
critic_grad_norm = torch.nn.utils.clip_grad_norm_(
self.critic_params, self.args.grad_norm_clip
)
self.critic_optimiser.step()
advantages = td_error.detach().unsqueeze(-1)
for _ in range(self.args.ppo_epoch):
policy = self._policy_outputs(batch)
log_prob = torch.log(
torch.gather(policy, dim=3, index=actions).squeeze(3) + 1e-10
)
ratio = torch.exp(log_prob - old_log_prob.detach())
unclipped = ratio * advantages
clipped = torch.clamp(
ratio,
1 - self.args.clip_param,
1 + self.args.clip_param,
) * advantages
entropy = -(policy * torch.log(policy + 1e-10)).sum(-1)
policy_loss = -(
(torch.minimum(unclipped, clipped) + self.args.entropy_coef * entropy)
* agent_mask
).sum() / agent_mask.sum()
self.agent_optimiser.zero_grad()
policy_loss.backward()
agent_grad_norm = torch.nn.utils.clip_grad_norm_(
self.agent_params, self.args.grad_norm_clip
)
self.agent_optimiser.step()
self.critic_training_steps += 1
if (
self.critic_training_steps - self.last_target_update_step
>= self.args.target_update_interval
):
self.target_critic.load_state_dict(self.critic.state_dict())
self.last_target_update_step = self.critic_training_steps
if t_env - self.log_stats_t >= self.args.learner_log_interval:
self.logger.log_stat("critic_loss", critic_loss.item(), t_env)
self.logger.log_stat("critic_grad_norm", critic_grad_norm.item(), t_env)
self.logger.log_stat("policy_loss", policy_loss.item(), t_env)
self.logger.log_stat("agent_grad_norm", agent_grad_norm.item(), t_env)
advantage_mean = (advantages * agent_mask).sum().item() / agent_mask.sum().item()
self.logger.log_stat("advantage_mean", advantage_mean, t_env)
self.log_stats_t = t_env
def cuda(self):
self.mac.cuda()
self.critic.cuda()
self.target_critic.cuda()
def save_models(self, path):
self.mac.save_models(path)
torch.save(self.critic.state_dict(), f"{path}/critic.th")
torch.save(self.agent_optimiser.state_dict(), f"{path}/agent_opt.th")
torch.save(self.critic_optimiser.state_dict(), f"{path}/critic_opt.th")
def load_models(self, path):
self.mac.load_models(path)
self.critic.load_state_dict(torch.load(f"{path}/critic.th", map_location="cpu"))
self.target_critic.load_state_dict(self.critic.state_dict())
self.agent_optimiser.load_state_dict(
torch.load(f"{path}/agent_opt.th", map_location="cpu")
)
self.critic_optimiser.load_state_dict(
torch.load(f"{path}/critic_opt.th", map_location="cpu")
)