Team Ai
Apppublic

TwoPerCent/instruct-pix2pix

sourceHugging Faceupdated 4y agoView on Hugging Face
0likes
main.py800 linesDownload Raw Back to root
1import argparse, os, sys, datetime, glob2import numpy as np3import time4import torch5import torchvision6import pytorch_lightning as pl7import json8import pickle9 10from packaging import version11from omegaconf import OmegaConf12from torch.utils.data import DataLoader, Dataset13from functools import partial14from PIL import Image15 16import torch.distributed as dist17from pytorch_lightning import seed_everything18from pytorch_lightning.trainer import Trainer19from pytorch_lightning.callbacks import ModelCheckpoint, Callback, LearningRateMonitor20from pytorch_lightning.utilities.distributed import rank_zero_only21from pytorch_lightning.utilities import rank_zero_info22from pytorch_lightning.plugins import DDPPlugin23 24sys.path.append("./stable_diffusion")25 26from ldm.data.base import Txt2ImgIterableBaseDataset27from ldm.util import instantiate_from_config28 29 30def get_parser(**parser_kwargs):31    def str2bool(v):32        if isinstance(v, bool):33            return v34        if v.lower() in ("yes", "true", "t", "y", "1"):35            return True36        elif v.lower() in ("no", "false", "f", "n", "0"):37            return False38        else:39            raise argparse.ArgumentTypeError("Boolean value expected.")40 41    parser = argparse.ArgumentParser(**parser_kwargs)42    parser.add_argument(43        "-n",44        "--name",45        type=str,46        const=True,47        default="",48        nargs="?",49        help="postfix for logdir",50    )51    parser.add_argument(52        "-r",53        "--resume",54        type=str,55        const=True,56        default="",57        nargs="?",58        help="resume from logdir or checkpoint in logdir",59    )60    parser.add_argument(61        "-b",62        "--base",63        nargs="*",64        metavar="base_config.yaml",65        help="paths to base configs. Loaded from left-to-right. "66             "Parameters can be overwritten or added with command-line options of the form `--key value`.",67        default=list(),68    )69    parser.add_argument(70        "-t",71        "--train",72        type=str2bool,73        const=True,74        default=False,75        nargs="?",76        help="train",77    )78    parser.add_argument(79        "--no-test",80        type=str2bool,81        const=True,82        default=False,83        nargs="?",84        help="disable test",85    )86    parser.add_argument(87        "-p",88        "--project",89        help="name of new or path to existing project"90    )91    parser.add_argument(92        "-d",93        "--debug",94        type=str2bool,95        nargs="?",96        const=True,97        default=False,98        help="enable post-mortem debugging",99    )100    parser.add_argument(101        "-s",102        "--seed",103        type=int,104        default=23,105        help="seed for seed_everything",106    )107    parser.add_argument(108        "-f",109        "--postfix",110        type=str,111        default="",112        help="post-postfix for default name",113    )114    parser.add_argument(115        "-l",116        "--logdir",117        type=str,118        default="logs",119        help="directory for logging dat shit",120    )121    parser.add_argument(122        "--scale_lr",123        action="store_true",124        default=False,125        help="scale base-lr by ngpu * batch_size * n_accumulate",126    )127    return parser128 129 130def nondefault_trainer_args(opt):131    parser = argparse.ArgumentParser()132    parser = Trainer.add_argparse_args(parser)133    args = parser.parse_args([])134    return sorted(k for k in vars(args) if getattr(opt, k) != getattr(args, k))135 136 137class WrappedDataset(Dataset):138    """Wraps an arbitrary object with __len__ and __getitem__ into a pytorch dataset"""139 140    def __init__(self, dataset):141        self.data = dataset142 143    def __len__(self):144        return len(self.data)145 146    def __getitem__(self, idx):147        return self.data[idx]148 149 150def worker_init_fn(_):151    worker_info = torch.utils.data.get_worker_info()152 153    dataset = worker_info.dataset154    worker_id = worker_info.id155 156    if isinstance(dataset, Txt2ImgIterableBaseDataset):157        split_size = dataset.num_records // worker_info.num_workers158        # reset num_records to the true number to retain reliable length information159        dataset.sample_ids = dataset.valid_ids[worker_id * split_size:(worker_id + 1) * split_size]160        current_id = np.random.choice(len(np.random.get_state()[1]), 1)161        return np.random.seed(np.random.get_state()[1][current_id] + worker_id)162    else:163        return np.random.seed(np.random.get_state()[1][0] + worker_id)164 165 166class DataModuleFromConfig(pl.LightningDataModule):167    def __init__(self, batch_size, train=None, validation=None, test=None, predict=None,168                 wrap=False, num_workers=None, shuffle_test_loader=False, use_worker_init_fn=False,169                 shuffle_val_dataloader=False):170        super().__init__()171        self.batch_size = batch_size172        self.dataset_configs = dict()173        self.num_workers = num_workers if num_workers is not None else batch_size * 2174        self.use_worker_init_fn = use_worker_init_fn175        if train is not None:176            self.dataset_configs["train"] = train177            self.train_dataloader = self._train_dataloader178        if validation is not None:179            self.dataset_configs["validation"] = validation180            self.val_dataloader = partial(self._val_dataloader, shuffle=shuffle_val_dataloader)181        if test is not None:182            self.dataset_configs["test"] = test183            self.test_dataloader = partial(self._test_dataloader, shuffle=shuffle_test_loader)184        if predict is not None:185            self.dataset_configs["predict"] = predict186            self.predict_dataloader = self._predict_dataloader187        self.wrap = wrap188 189    def prepare_data(self):190        for data_cfg in self.dataset_configs.values():191            instantiate_from_config(data_cfg)192 193    def setup(self, stage=None):194        self.datasets = dict(195            (k, instantiate_from_config(self.dataset_configs[k]))196            for k in self.dataset_configs)197        if self.wrap:198            for k in self.datasets:199                self.datasets[k] = WrappedDataset(self.datasets[k])200 201    def _train_dataloader(self):202        is_iterable_dataset = isinstance(self.datasets['train'], Txt2ImgIterableBaseDataset)203        if is_iterable_dataset or self.use_worker_init_fn:204            init_fn = worker_init_fn205        else:206            init_fn = None207        return DataLoader(self.datasets["train"], batch_size=self.batch_size,208                          num_workers=self.num_workers, shuffle=False if is_iterable_dataset else True,209                          worker_init_fn=init_fn, persistent_workers=True)210 211    def _val_dataloader(self, shuffle=False):212        if isinstance(self.datasets['validation'], Txt2ImgIterableBaseDataset) or self.use_worker_init_fn:213            init_fn = worker_init_fn214        else:215            init_fn = None216        return DataLoader(self.datasets["validation"],217                          batch_size=self.batch_size,218                          num_workers=self.num_workers,219                          worker_init_fn=init_fn,220                          shuffle=shuffle, persistent_workers=True)221 222    def _test_dataloader(self, shuffle=False):223        is_iterable_dataset = isinstance(self.datasets['train'], Txt2ImgIterableBaseDataset)224        if is_iterable_dataset or self.use_worker_init_fn:225            init_fn = worker_init_fn226        else:227            init_fn = None228 229        # do not shuffle dataloader for iterable dataset230        shuffle = shuffle and (not is_iterable_dataset)231 232        return DataLoader(self.datasets["test"], batch_size=self.batch_size,233                          num_workers=self.num_workers, worker_init_fn=init_fn, shuffle=shuffle, persistent_workers=True)234 235    def _predict_dataloader(self, shuffle=False):236        if isinstance(self.datasets['predict'], Txt2ImgIterableBaseDataset) or self.use_worker_init_fn:237            init_fn = worker_init_fn238        else:239            init_fn = None240        return DataLoader(self.datasets["predict"], batch_size=self.batch_size,241                          num_workers=self.num_workers, worker_init_fn=init_fn, persistent_workers=True)242 243 244class SetupCallback(Callback):245    def __init__(self, resume, now, logdir, ckptdir, cfgdir, config, lightning_config):246        super().__init__()247        self.resume = resume248        self.now = now249        self.logdir = logdir250        self.ckptdir = ckptdir251        self.cfgdir = cfgdir252        self.config = config253        self.lightning_config = lightning_config254 255    def on_keyboard_interrupt(self, trainer, pl_module):256        if trainer.global_rank == 0:257            print("Summoning checkpoint.")258            ckpt_path = os.path.join(self.ckptdir, "last.ckpt")259            trainer.save_checkpoint(ckpt_path)260 261    def on_pretrain_routine_start(self, trainer, pl_module):262        if trainer.global_rank == 0:263            # Create logdirs and save configs264            # os.makedirs(self.logdir, exist_ok=True)265            # os.makedirs(self.ckptdir, exist_ok=True)266            # os.makedirs(self.cfgdir, exist_ok=True)267 268            if "callbacks" in self.lightning_config:269                if 'metrics_over_trainsteps_checkpoint' in self.lightning_config['callbacks']:270                    os.makedirs(os.path.join(self.ckptdir, 'trainstep_checkpoints'), exist_ok=True)271            print("Project config")272            print(OmegaConf.to_yaml(self.config))273            OmegaConf.save(self.config,274                           os.path.join(self.cfgdir, "{}-project.yaml".format(self.now)))275 276            print("Lightning config")277            print(OmegaConf.to_yaml(self.lightning_config))278            OmegaConf.save(OmegaConf.create({"lightning": self.lightning_config}),279                           os.path.join(self.cfgdir, "{}-lightning.yaml".format(self.now)))280 281def get_world_size():282    if not dist.is_available():283        return 1284    if not dist.is_initialized():285        return 1286    return dist.get_world_size()287 288def all_gather(data):289    """290    Run all_gather on arbitrary picklable data (not necessarily tensors)291    Args:292        data: any picklable object293    Returns:294        list[data]: list of data gathered from each rank295    """296    world_size = get_world_size()297    if world_size == 1:298        return [data]299 300    # serialized to a Tensor301    origin_size = None302    if not isinstance(data, torch.Tensor):303        buffer = pickle.dumps(data)304        storage = torch.ByteStorage.from_buffer(buffer)305        tensor = torch.ByteTensor(storage).to("cuda")306    else:307        origin_size = data.size()308        tensor = data.reshape(-1)309 310    tensor_type = tensor.dtype311 312    # obtain Tensor size of each rank313    local_size = torch.LongTensor([tensor.numel()]).to("cuda")314    size_list = [torch.LongTensor([0]).to("cuda") for _ in range(world_size)]315    dist.all_gather(size_list, local_size)316    size_list = [int(size.item()) for size in size_list]317    max_size = max(size_list)318 319    # receiving Tensor from all ranks320    # we pad the tensor because torch all_gather does not support321    # gathering tensors of different shapes322    tensor_list = []323    for _ in size_list:324        tensor_list.append(torch.FloatTensor(size=(max_size,)).cuda().to(tensor_type))325    if local_size != max_size:326        padding = torch.FloatTensor(size=(max_size - local_size,)).cuda().to(tensor_type)327        tensor = torch.cat((tensor, padding), dim=0)328    dist.all_gather(tensor_list, tensor)329 330    data_list = []331    for size, tensor in zip(size_list, tensor_list):332        if origin_size is None:333            buffer = tensor.cpu().numpy().tobytes()[:size]334            data_list.append(pickle.loads(buffer))335        else:336            buffer = tensor[:size]337            data_list.append(buffer)338 339    if origin_size is not None:340        new_shape = [-1] + list(origin_size[1:])341        resized_list = []342        for data in data_list:343            # suppose the difference of tensor size exist in first dimension344            data = data.reshape(new_shape)345            resized_list.append(data)346 347        return resized_list348    else:349        return data_list350 351class ImageLogger(Callback):352    def __init__(self, batch_frequency, max_images, clamp=True, increase_log_steps=True,353                 rescale=True, disabled=False, log_on_batch_idx=False, log_first_step=False,354                 log_images_kwargs=None):355        super().__init__()356        self.rescale = rescale357        self.batch_freq = batch_frequency358        self.max_images = max_images359        self.logger_log_images = {360            pl.loggers.TestTubeLogger: self._testtube,361        }362        self.log_steps = [2 ** n for n in range(6, int(np.log2(self.batch_freq)) + 1)]363        if not increase_log_steps:364            self.log_steps = [self.batch_freq]365        self.clamp = clamp366        self.disabled = disabled367        self.log_on_batch_idx = log_on_batch_idx368        self.log_images_kwargs = log_images_kwargs if log_images_kwargs else {}369        self.log_first_step = log_first_step370 371    @rank_zero_only372    def _testtube(self, pl_module, images, batch_idx, split):373        for k in images:374            grid = torchvision.utils.make_grid(images[k])375            grid = (grid + 1.0) / 2.0  # -1,1 -> 0,1; c,h,w376 377            tag = f"{split}/{k}"378            pl_module.logger.experiment.add_image(379                tag, grid,380                global_step=pl_module.global_step)381 382    @rank_zero_only383    def log_local(self, save_dir, split, images, prompts,384                  global_step, current_epoch, batch_idx):385        root = os.path.join(save_dir, "images", split)386        names = {"reals": "before", "inputs": "after", "reconstruction": "before-vq", "samples": "after-gen"}387        # print(root)388        for k in images:389            grid = torchvision.utils.make_grid(images[k], nrow=8)390            if self.rescale:391                grid = (grid + 1.0) / 2.0  # -1,1 -> 0,1; c,h,w392            grid = grid.transpose(0, 1).transpose(1, 2).squeeze(-1)393            grid = grid.numpy()394            grid = (grid * 255).astype(np.uint8)395            filename = "gs-{:06}_e-{:06}_b-{:06}_{}.png".format(396                global_step,397                current_epoch,398                batch_idx,399                names[k])400            path = os.path.join(root, filename)401            os.makedirs(os.path.split(path)[0], exist_ok=True)402            # print(path)403            Image.fromarray(grid).save(path)404 405        filename = "gs-{:06}_e-{:06}_b-{:06}_prompt.json".format(406            global_step,407            current_epoch,408            batch_idx)409        path = os.path.join(root, filename)410        with open(path, "w") as f:411            for p in prompts:412                f.write(f"{json.dumps(p)}\n")413 414    def log_img(self, pl_module, batch, batch_idx, split="train"):415        check_idx = batch_idx if self.log_on_batch_idx else pl_module.global_step416        if (self.check_frequency(check_idx) and  # batch_idx % self.batch_freq == 0417                hasattr(pl_module, "log_images") and418                callable(pl_module.log_images) and419                self.max_images > 0) or (split == "val" and batch_idx == 0):420            logger = type(pl_module.logger)421 422            is_train = pl_module.training423            if is_train:424                pl_module.eval()425 426            with torch.no_grad():427                images = pl_module.log_images(batch, split=split, **self.log_images_kwargs)428 429            prompts = batch["edit"]["c_crossattn"][:self.max_images]430            prompts = [p for ps in all_gather(prompts) for p in ps]431 432            for k in images:433                N = min(images[k].shape[0], self.max_images)434                images[k] = images[k][:N]435                images[k] = torch.cat(all_gather(images[k][:N]))436                if isinstance(images[k], torch.Tensor):437                    images[k] = images[k].detach().cpu()438                    if self.clamp:439                        images[k] = torch.clamp(images[k], -1., 1.)440 441            self.log_local(pl_module.logger.save_dir, split, images, prompts,442                           pl_module.global_step, pl_module.current_epoch, batch_idx)443 444            logger_log_images = self.logger_log_images.get(logger, lambda *args, **kwargs: None)445            logger_log_images(pl_module, images, pl_module.global_step, split)446 447            if is_train:448                pl_module.train()449 450    def check_frequency(self, check_idx):451        if ((check_idx % self.batch_freq) == 0 or (check_idx in self.log_steps)) and (452                check_idx > 0 or self.log_first_step):453            if len(self.log_steps) > 0:454                self.log_steps.pop(0)455            return True456        return False457 458    def on_train_batch_end(self, trainer, pl_module, outputs, batch, batch_idx, dataloader_idx):459        if not self.disabled and (pl_module.global_step > 0 or self.log_first_step):460            self.log_img(pl_module, batch, batch_idx, split="train")461 462    def on_validation_batch_end(self, trainer, pl_module, outputs, batch, batch_idx, dataloader_idx):463        if not self.disabled and pl_module.global_step > 0:464            self.log_img(pl_module, batch, batch_idx, split="val")465        if hasattr(pl_module, 'calibrate_grad_norm'):466            if (pl_module.calibrate_grad_norm and batch_idx % 25 == 0) and batch_idx > 0:467                self.log_gradients(trainer, pl_module, batch_idx=batch_idx)468 469 470class CUDACallback(Callback):471    # see https://github.com/SeanNaren/minGPT/blob/master/mingpt/callback.py472    def on_train_epoch_start(self, trainer, pl_module):473        # Reset the memory use counter474        torch.cuda.reset_peak_memory_stats(trainer.root_gpu)475        torch.cuda.synchronize(trainer.root_gpu)476        self.start_time = time.time()477 478    def on_train_epoch_end(self, trainer, pl_module, outputs):479        torch.cuda.synchronize(trainer.root_gpu)480        max_memory = torch.cuda.max_memory_allocated(trainer.root_gpu) / 2 ** 20481        epoch_time = time.time() - self.start_time482 483        try:484            max_memory = trainer.training_type_plugin.reduce(max_memory)485            epoch_time = trainer.training_type_plugin.reduce(epoch_time)486 487            rank_zero_info(f"Average Epoch time: {epoch_time:.2f} seconds")488            rank_zero_info(f"Average Peak memory {max_memory:.2f}MiB")489        except AttributeError:490            pass491 492 493if __name__ == "__main__":494    # custom parser to specify config files, train, test and debug mode,495    # postfix, resume.496    # `--key value` arguments are interpreted as arguments to the trainer.497    # `nested.key=value` arguments are interpreted as config parameters.498    # configs are merged from left-to-right followed by command line parameters.499 500    # model:501    #   base_learning_rate: float502    #   target: path to lightning module503    #   params:504    #       key: value505    # data:506    #   target: main.DataModuleFromConfig507    #   params:508    #      batch_size: int509    #      wrap: bool510    #      train:511    #          target: path to train dataset512    #          params:513    #              key: value514    #      validation:515    #          target: path to validation dataset516    #          params:517    #              key: value518    #      test:519    #          target: path to test dataset520    #          params:521    #              key: value522    # lightning: (optional, has sane defaults and can be specified on cmdline)523    #   trainer:524    #       additional arguments to trainer525    #   logger:526    #       logger to instantiate527    #   modelcheckpoint:528    #       modelcheckpoint to instantiate529    #   callbacks:530    #       callback1:531    #           target: importpath532    #           params:533    #               key: value534 535    now = datetime.datetime.now().strftime("%Y-%m-%dT%H-%M-%S")536 537    # add cwd for convenience and to make classes in this file available when538    # running as `python main.py`539    # (in particular `main.DataModuleFromConfig`)540    sys.path.append(os.getcwd())541 542    parser = get_parser()543    parser = Trainer.add_argparse_args(parser)544 545    opt, unknown = parser.parse_known_args()546 547    assert opt.name548    cfg_fname = os.path.split(opt.base[0])[-1]549    cfg_name = os.path.splitext(cfg_fname)[0]550    nowname = f"{cfg_name}_{opt.name}"551    logdir = os.path.join(opt.logdir, nowname)552    ckpt = os.path.join(logdir, "checkpoints", "last.ckpt")553    resume = False554 555    if os.path.isfile(ckpt):556        opt.resume_from_checkpoint = ckpt557        base_configs = sorted(glob.glob(os.path.join(logdir, "configs/*.yaml")))558        opt.base = base_configs + opt.base559        _tmp = logdir.split("/")560        nowname = _tmp[-1]561        resume = True562 563    ckptdir = os.path.join(logdir, "checkpoints")564    cfgdir = os.path.join(logdir, "configs")565 566    os.makedirs(logdir, exist_ok=True)567    os.makedirs(ckptdir, exist_ok=True)568    os.makedirs(cfgdir, exist_ok=True)569 570    try:571        # init and save configs572        configs = [OmegaConf.load(cfg) for cfg in opt.base]573        cli = OmegaConf.from_dotlist(unknown)574        config = OmegaConf.merge(*configs, cli)575 576        if resume:577            # By default, when finetuning from Stable Diffusion, we load the EMA-only checkpoint to initialize all weights.578            # If resuming InstructPix2Pix from a finetuning checkpoint, instead load both EMA and non-EMA weights.579            config.model.params.load_ema = True580 581        lightning_config = config.pop("lightning", OmegaConf.create())582        # merge trainer cli with config583        trainer_config = lightning_config.get("trainer", OmegaConf.create())584        # default to ddp585        trainer_config["accelerator"] = "ddp"586        for k in nondefault_trainer_args(opt):587            trainer_config[k] = getattr(opt, k)588        if not "gpus" in trainer_config:589            del trainer_config["accelerator"]590            cpu = True591        else:592            gpuinfo = trainer_config["gpus"]593            print(f"Running on GPUs {gpuinfo}")594            cpu = False595        trainer_opt = argparse.Namespace(**trainer_config)596        lightning_config.trainer = trainer_config597 598        # model599        model = instantiate_from_config(config.model)600 601        # trainer and callbacks602        trainer_kwargs = dict()603 604        # default logger configs605        default_logger_cfgs = {606            "wandb": {607                "target": "pytorch_lightning.loggers.WandbLogger",608                "params": {609                    "name": nowname,610                    "save_dir": logdir,611                    "id": nowname,612                }613            },614            "testtube": {615                "target": "pytorch_lightning.loggers.TestTubeLogger",616                "params": {617                    "name": "testtube",618                    "save_dir": logdir,619                }620            },621        }622        default_logger_cfg = default_logger_cfgs["wandb"]623        if "logger" in lightning_config:624            logger_cfg = lightning_config.logger625        else:626            logger_cfg = OmegaConf.create()627        logger_cfg = OmegaConf.merge(default_logger_cfg, logger_cfg)628        trainer_kwargs["logger"] = instantiate_from_config(logger_cfg)629 630        # modelcheckpoint - use TrainResult/EvalResult(checkpoint_on=metric) to631        # specify which metric is used to determine best models632        default_modelckpt_cfg = {633            "target": "pytorch_lightning.callbacks.ModelCheckpoint",634            "params": {635                "dirpath": ckptdir,636                "filename": "{epoch:06}",637                "verbose": True,638                "save_last": True,639            }640        }641 642        if "modelcheckpoint" in lightning_config:643            modelckpt_cfg = lightning_config.modelcheckpoint644        else:645            modelckpt_cfg =  OmegaConf.create()646        modelckpt_cfg = OmegaConf.merge(default_modelckpt_cfg, modelckpt_cfg)647        print(f"Merged modelckpt-cfg: \n{modelckpt_cfg}")648        if version.parse(pl.__version__) < version.parse('1.4.0'):649            trainer_kwargs["checkpoint_callback"] = instantiate_from_config(modelckpt_cfg)650 651        # add callback which sets up log directory652        default_callbacks_cfg = {653            "setup_callback": {654                "target": "main.SetupCallback",655                "params": {656                    "resume": opt.resume,657                    "now": now,658                    "logdir": logdir,659                    "ckptdir": ckptdir,660                    "cfgdir": cfgdir,661                    "config": config,662                    "lightning_config": lightning_config,663                }664            },665            "image_logger": {666                "target": "main.ImageLogger",667                "params": {668                    "batch_frequency": 750,669                    "max_images": 4,670                    "clamp": True671                }672            },673            "learning_rate_logger": {674                "target": "main.LearningRateMonitor",675                "params": {676                    "logging_interval": "step",677                    # "log_momentum": True678                }679            },680            "cuda_callback": {681                "target": "main.CUDACallback"682            },683        }684        if version.parse(pl.__version__) >= version.parse('1.4.0'):685            default_callbacks_cfg.update({'checkpoint_callback': modelckpt_cfg})686 687        if "callbacks" in lightning_config:688            callbacks_cfg = lightning_config.callbacks689        else:690            callbacks_cfg = OmegaConf.create()691 692        print(693            'Caution: Saving checkpoints every n train steps without deleting. This might require some free space.')694        default_metrics_over_trainsteps_ckpt_dict = {695            'metrics_over_trainsteps_checkpoint': {696                "target": 'pytorch_lightning.callbacks.ModelCheckpoint',697                'params': {698                    "dirpath": os.path.join(ckptdir, 'trainstep_checkpoints'),699                    "filename": "{epoch:06}-{step:09}",700                    "verbose": True,701                    'save_top_k': -1,702                    'every_n_train_steps': 1000,703                    'save_weights_only': True704                }705            }706        }707        default_callbacks_cfg.update(default_metrics_over_trainsteps_ckpt_dict)708 709        callbacks_cfg = OmegaConf.merge(default_callbacks_cfg, callbacks_cfg)710        if 'ignore_keys_callback' in callbacks_cfg and hasattr(trainer_opt, 'resume_from_checkpoint'):711            callbacks_cfg.ignore_keys_callback.params['ckpt_path'] = trainer_opt.resume_from_checkpoint712        elif 'ignore_keys_callback' in callbacks_cfg:713            del callbacks_cfg['ignore_keys_callback']714 715        trainer_kwargs["callbacks"] = [instantiate_from_config(callbacks_cfg[k]) for k in callbacks_cfg]716 717        trainer = Trainer.from_argparse_args(trainer_opt, plugins=DDPPlugin(find_unused_parameters=False), **trainer_kwargs)718        trainer.logdir = logdir  ###719 720        # data721        data = instantiate_from_config(config.data)722        # NOTE according to https://pytorch-lightning.readthedocs.io/en/latest/datamodules.html723        # calling these ourselves should not be necessary but it is.724        # lightning still takes care of proper multiprocessing though725        data.prepare_data()726        data.setup()727        print("#### Data #####")728        for k in data.datasets:729            print(f"{k}, {data.datasets[k].__class__.__name__}, {len(data.datasets[k])}")730 731        # configure learning rate732        bs, base_lr = config.data.params.batch_size, config.model.base_learning_rate733        if not cpu:734            ngpu = len(lightning_config.trainer.gpus.strip(",").split(','))735        else:736            ngpu = 1737        if 'accumulate_grad_batches' in lightning_config.trainer:738            accumulate_grad_batches = lightning_config.trainer.accumulate_grad_batches739        else:740            accumulate_grad_batches = 1741        print(f"accumulate_grad_batches = {accumulate_grad_batches}")742        lightning_config.trainer.accumulate_grad_batches = accumulate_grad_batches743        if opt.scale_lr:744            model.learning_rate = accumulate_grad_batches * ngpu * bs * base_lr745            print(746                "Setting learning rate to {:.2e} = {} (accumulate_grad_batches) * {} (num_gpus) * {} (batchsize) * {:.2e} (base_lr)".format(747                    model.learning_rate, accumulate_grad_batches, ngpu, bs, base_lr))748        else:749            model.learning_rate = base_lr750            print("++++ NOT USING LR SCALING ++++")751            print(f"Setting learning rate to {model.learning_rate:.2e}")752 753 754        # allow checkpointing via USR1755        def melk(*args, **kwargs):756            # run all checkpoint hooks757            if trainer.global_rank == 0:758                print("Summoning checkpoint.")759                ckpt_path = os.path.join(ckptdir, "last.ckpt")760                trainer.save_checkpoint(ckpt_path)761 762 763        def divein(*args, **kwargs):764            if trainer.global_rank == 0:765                import pudb;766                pudb.set_trace()767 768 769        import signal770 771        signal.signal(signal.SIGUSR1, melk)772        signal.signal(signal.SIGUSR2, divein)773 774        # run775        if opt.train:776            try:777                trainer.fit(model, data)778            except Exception:779                melk()780                raise781        if not opt.no_test and not trainer.interrupted:782            trainer.test(model, data)783    except Exception:784        if opt.debug and trainer.global_rank == 0:785            try:786                import pudb as debugger787            except ImportError:788                import pdb as debugger789            debugger.post_mortem()790        raise791    finally:792        # move newly created debug project to debug_runs793        if opt.debug and not opt.resume and trainer.global_rank == 0:794            dst, name = os.path.split(logdir)795            dst = os.path.join(dst, "debug_runs", name)796            os.makedirs(os.path.split(dst)[0], exist_ok=True)797            os.rename(logdir, dst)798        if trainer.global_rank == 0:799            print(trainer.profiler.summary())800