{ "history": [ { "epoch": 1, "train_loss": 0.953, "val_loss": 0.0244, "examples_per_sec": 1.3, "elapsed_sec": 3331.1 }, { "epoch": 2, "train_loss": 0.0203, "val_loss": 0.0177, "examples_per_sec": 1.3, "elapsed_sec": 3318.3 }, { "epoch": 3, "train_loss": 0.0151, "val_loss": 0.0151, "examples_per_sec": 1.3, "elapsed_sec": 3321.8 }, { "epoch": 4, "train_loss": 0.0125, "val_loss": 0.0147, "examples_per_sec": 1.3, "elapsed_sec": 3318.8 }, { "epoch": 5, "train_loss": 0.0109, "val_loss": 0.0146, "examples_per_sec": 1.3, "elapsed_sec": 3317.5 } ], "best_val_loss": 0.0146, "config": { "seed": 42, "data": { "num_workers": 4 }, "model": { "name": "meta-llama/Llama-3.2-11B-Vision-Instruct" }, "lora": { "rank": 16, "alpha": 32, "dropout": 0.05, "target_modules": [ "q_proj", "v_proj", "k_proj", "o_proj", "gate_proj", "up_proj", "down_proj" ] }, "train": { "epochs": 5, "batch_size": 4, "grad_accum_steps": 4, "lr": 2e-05, "weight_decay": 0.01, "betas": [ 0.9, 0.999 ], "warmup_ratio": 0.1, "grad_clip": 1.0, "max_length": 2048 }, "log": { "every_n_steps": 25 } } }