From 8b559d71ab7eca97790be7263ab3c827004d430b Mon Sep 17 00:00:00 2001 From: Antonin Raffin Date: Fri, 14 Feb 2020 13:42:16 +0100 Subject: [PATCH] Remove deprecated monitor format and improve tests --- docs/misc/changelog.rst | 1 + tests/test_monitor.py | 40 +++++++++++++++++-------- torchy_baselines/common/monitor.py | 48 ++++++++++-------------------- 3 files changed, 44 insertions(+), 45 deletions(-) diff --git a/docs/misc/changelog.rst b/docs/misc/changelog.rst index 02bf897..ea784b6 100644 --- a/docs/misc/changelog.rst +++ b/docs/misc/changelog.rst @@ -12,6 +12,7 @@ Breaking Changes: - Return type of `evaluation.evaluate_policy()` has been changed - Refactored the replay buffer to avoid transformation between PyTorch and NumPy - Created `OffPolicyRLModel` base class +- Remove deprecated JSON format for `Monitor` New Features: ^^^^^^^^^^^^^ diff --git a/tests/test_monitor.py b/tests/test_monitor.py index 141b2c0..d783f25 100644 --- a/tests/test_monitor.py +++ b/tests/test_monitor.py @@ -8,33 +8,47 @@ import gym from torchy_baselines.common.monitor import Monitor, get_monitor_files, load_results -def test_monitor(): +def test_monitor(tmp_path): """ test the monitor wrapper """ env = gym.make("CartPole-v1") env.seed(0) - monitor_file = "/tmp/stable_baselines-test-{}.monitor.csv".format(uuid.uuid4()) + monitor_file = os.path.join(str(tmp_path), "stable_baselines-test-{}.monitor.csv".format(uuid.uuid4())) monitor_env = Monitor(env, monitor_file) monitor_env.reset() - for _ in range(1000): - _, _, done, _ = monitor_env.step(0) + total_steps = 1000 + ep_rewards = [] + ep_lengths = [] + ep_len, ep_reward = 0, 0 + for _ in range(total_steps): + _, reward, done, _ = monitor_env.step(0) + ep_len += 1 + ep_reward += reward if done: + ep_rewards.append(ep_reward) + ep_lengths.append(ep_len) monitor_env.reset() + ep_len, ep_reward = 0, 0 - file_handler = open(monitor_file, 'rt') + monitor_env.close() + assert monitor_env.get_total_steps() == total_steps + assert sum(ep_lengths) == sum(monitor_env.get_episode_lengths()) + assert sum(monitor_env.get_episode_rewards()) == sum(ep_rewards) + _ = monitor_env.get_episode_times() - first_line = file_handler.readline() - assert first_line.startswith('#') - metadata = json.loads(first_line[1:]) - assert metadata['env_id'] == "CartPole-v1" - assert set(metadata.keys()) == {'env_id', 't_start'}, "Incorrect keys in monitor metadata" + with open(monitor_file, 'rt') as file_handler: + first_line = file_handler.readline() + assert first_line.startswith('#') + metadata = json.loads(first_line[1:]) + assert metadata['env_id'] == "CartPole-v1" + assert set(metadata.keys()) == {'env_id', 't_start'}, "Incorrect keys in monitor metadata" - last_logline = pandas.read_csv(file_handler, index_col=None) - assert set(last_logline.keys()) == {'l', 't', 'r'}, "Incorrect keys in monitor logline" - file_handler.close() + last_logline = pandas.read_csv(file_handler, index_col=None) + assert set(last_logline.keys()) == {'l', 't', 'r'}, "Incorrect keys in monitor logline" os.remove(monitor_file) + def test_monitor_load_results(tmp_path): """ test load_results on log files produced by the monitor wrapper diff --git a/torchy_baselines/common/monitor.py b/torchy_baselines/common/monitor.py index 88bea45..3d84b9b 100644 --- a/torchy_baselines/common/monitor.py +++ b/torchy_baselines/common/monitor.py @@ -14,22 +14,21 @@ import numpy as np class Monitor(gym.Wrapper): EXT = "monitor.csv" - file_handler = None def __init__(self, env: gym.Env, filename: Optional[str] = None, allow_early_resets: bool = True, - reset_keywords=(), - info_keywords=()): + reset_keywords: Tuple[str, ...] = (), + info_keywords: Tuple[str, ...] = ()): """ A monitor wrapper for Gym environments, it is used to know the episode reward, length, time and other data. :param env: (gym.Env) The environment :param filename: (Optional[str]) the location to save a log file, can be None for no log :param allow_early_resets: (bool) allows the reset of the environment before it is done - :param reset_keywords: (tuple) extra keywords for the reset call, if extra parameters are needed at reset - :param info_keywords: (tuple) extra information to log, from the information return of environment.step + :param reset_keywords: (Tuple[str, ...]) extra keywords for the reset call, if extra parameters are needed at reset + :param info_keywords: (Tuple[str, ...]) extra information to log, from the information return of environment.step """ super(Monitor, self).__init__(env=env) self.t_start = time.time() @@ -93,12 +92,12 @@ class Monitor(gym.Wrapper): if done: self.needs_reset = True ep_rew = sum(self.rewards) - eplen = len(self.rewards) - ep_info = {"r": round(ep_rew, 6), "l": eplen, "t": round(time.time() - self.t_start, 6)} + ep_len = len(self.rewards) + ep_info = {"r": round(ep_rew, 6), "l": ep_len, "t": round(time.time() - self.t_start, 6)} for key in self.info_keywords: ep_info[key] = info[key] self.episode_rewards.append(ep_rew) - self.episode_lengths.append(eplen) + self.episode_lengths.append(ep_len) self.episode_times.append(time.time() - self.t_start) ep_info.update(self.current_reset_info) if self.logger: @@ -168,41 +167,26 @@ def get_monitor_files(path: str) -> List[str]: def load_results(path: str) -> pandas.DataFrame: """ - Load all Monitor logs from a given directory path matching ``*monitor.csv`` and ``*monitor.json`` + Load all Monitor logs from a given directory path matching ``*monitor.csv`` :param path: (str) the directory path containing the log file(s) :return: (pandas.DataFrame) the logged data """ - # get both csv and (old) json files - monitor_files = (glob(os.path.join(path, "*monitor.json")) + get_monitor_files(path)) - if not monitor_files: + monitor_files = get_monitor_files(path) + if len(monitor_files) == 0: raise LoadMonitorResultsError("no monitor files of the form *%s found in %s" % (Monitor.EXT, path)) - data_frames = [] - headers = [] + data_frames, headers = [], [] for file_name in monitor_files: with open(file_name, 'rt') as file_handler: - if file_name.endswith('csv'): - first_line = file_handler.readline() - assert first_line[0] == '#' - header = json.loads(first_line[1:]) - data_frame = pandas.read_csv(file_handler, index_col=None) - headers.append(header) - elif file_name.endswith('json'): # Deprecated json format - episodes = [] - lines = file_handler.readlines() - header = json.loads(lines[0]) - headers.append(header) - for line in lines[1:]: - episode = json.loads(line) - episodes.append(episode) - data_frame = pandas.DataFrame(episodes) - else: - assert 0, 'unreachable' + first_line = file_handler.readline() + assert first_line[0] == '#' + header = json.loads(first_line[1:]) + data_frame = pandas.read_csv(file_handler, index_col=None) + headers.append(header) data_frame['t'] += header['t_start'] data_frames.append(data_frame) data_frame = pandas.concat(data_frames) data_frame.sort_values('t', inplace=True) data_frame.reset_index(inplace=True) data_frame['t'] -= min(header['t_start'] for header in headers) - # data_frame.headers = headers # HACK to preserve backwards compatibility return data_frame