Training in progress, step 6000, checkpoint

Browse files

Files changed (11) hide show

checkpoint-6000/README.md +34 -0
checkpoint-6000/adapter_config.json +20 -0
checkpoint-6000/adapter_model.bin +3 -0
checkpoint-6000/optimizer.pt +3 -0
checkpoint-6000/rng_state.pth +3 -0
checkpoint-6000/scheduler.pt +3 -0
checkpoint-6000/special_tokens_map.json +11 -0
checkpoint-6000/tokenizer.json +0 -0
checkpoint-6000/tokenizer_config.json +72 -0
checkpoint-6000/trainer_state.json +187 -0
checkpoint-6000/training_args.bin +3 -0

checkpoint-6000/README.md ADDED Viewed

	@@ -0,0 +1,34 @@

+---
+library_name: peft
+---
+## Training procedure
+The following `bitsandbytes` quantization config was used during training:
+- quant_method: bitsandbytes
+- load_in_8bit: True
+- load_in_4bit: False
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+The following `bitsandbytes` quantization config was used during training:
+- quant_method: bitsandbytes
+- load_in_8bit: True
+- load_in_4bit: False
+- llm_int8_threshold: 6.0
+- llm_int8_skip_modules: None
+- llm_int8_enable_fp32_cpu_offload: False
+- llm_int8_has_fp16_weight: False
+- bnb_4bit_quant_type: fp4
+- bnb_4bit_use_double_quant: False
+- bnb_4bit_compute_dtype: float32
+### Framework versions
+- PEFT 0.5.0
+- PEFT 0.5.0

checkpoint-6000/adapter_config.json ADDED Viewed

	@@ -0,0 +1,20 @@

+{
+  "auto_mapping": null,
+  "base_model_name_or_path": "EleutherAI/polyglot-ko-1.3b",
+  "bias": "none",
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "lora_alpha": 32,
+  "lora_dropout": 0.05,
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 16,
+  "revision": null,
+  "target_modules": [
+    "query_key_value"
+  ],
+  "task_type": "CAUSAL_LM"
+}

checkpoint-6000/adapter_model.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:46ac31236862012b285a689fe282c9fcf24b3f7bbf34613ff5216fea41004d4a
+size 12600958

checkpoint-6000/optimizer.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c256a74acff57ba6fc4b956a541a69e510a4b34a68dfae36db196c55dc455977
+size 25206586

checkpoint-6000/rng_state.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d9fbbce3a2e4293cbbbb4aa0e946405958b2c77a900313a3050783d28b1c807e
+size 14308

checkpoint-6000/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:fff7934a4185855e6e536ba55543a820079f14811f03d29272f9becf86c89cd8
+size 1064

checkpoint-6000/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,11 @@

+{
+  "additional_special_tokens": [
+    "<|endoftext|>",
+    "<|sep|>",
+    "<|acc|>",
+    "<|tel|>",
+    "<|rrn|>"
+  ],
+  "eos_token": "<|endoftext|>",
+  "pad_token": "<|endoftext|>"
+}

checkpoint-6000/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

checkpoint-6000/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,72 @@

+{
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<|unused0|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<|unused1|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "3": {
+      "content": "<|sep|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "30000": {
+      "content": "<|acc|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "30001": {
+      "content": "<|tel|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "30002": {
+      "content": "<|rrn|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "<|endoftext|>",
+    "<|sep|>",
+    "<|acc|>",
+    "<|tel|>",
+    "<|rrn|>"
+  ],
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<|endoftext|>",
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<|endoftext|>",
+  "tokenizer_class": "PreTrainedTokenizerFast"
+}

checkpoint-6000/trainer_state.json ADDED Viewed

	@@ -0,0 +1,187 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 11.583011583011583,
+  "eval_steps": 1000,
+  "global_step": 6000,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.58,
+      "learning_rate": 7.239382239382239e-07,
+      "loss": 2.3335,
+      "step": 300
+    },
+    {
+      "epoch": 1.16,
+      "learning_rate": 1.4478764478764478e-06,
+      "loss": 2.322,
+      "step": 600
+    },
+    {
+      "epoch": 1.74,
+      "learning_rate": 2.171814671814672e-06,
+      "loss": 2.268,
+      "step": 900
+    },
+    {
+      "epoch": 1.93,
+      "eval_loss": 2.2363617420196533,
+      "eval_runtime": 56.2328,
+      "eval_samples_per_second": 51.98,
+      "eval_steps_per_second": 3.254,
+      "step": 1000
+    },
+    {
+      "epoch": 2.32,
+      "learning_rate": 2.8957528957528956e-06,
+      "loss": 2.2427,
+      "step": 1200
+    },
+    {
+      "epoch": 2.9,
+      "learning_rate": 3.61969111969112e-06,
+      "loss": 2.2085,
+      "step": 1500
+    },
+    {
+      "epoch": 3.47,
+      "learning_rate": 4.343629343629344e-06,
+      "loss": 2.1902,
+      "step": 1800
+    },
+    {
+      "epoch": 3.86,
+      "eval_loss": 2.1604719161987305,
+      "eval_runtime": 56.4281,
+      "eval_samples_per_second": 51.8,
+      "eval_steps_per_second": 3.243,
+      "step": 2000
+    },
+    {
+      "epoch": 4.05,
+      "learning_rate": 5.067567567567568e-06,
+      "loss": 2.173,
+      "step": 2100
+    },
+    {
+      "epoch": 4.63,
+      "learning_rate": 5.791505791505791e-06,
+      "loss": 2.1517,
+      "step": 2400
+    },
+    {
+      "epoch": 5.21,
+      "learning_rate": 6.515444015444016e-06,
+      "loss": 2.135,
+      "step": 2700
+    },
+    {
+      "epoch": 5.79,
+      "learning_rate": 7.23938223938224e-06,
+      "loss": 2.1156,
+      "step": 3000
+    },
+    {
+      "epoch": 5.79,
+      "eval_loss": 2.108267068862915,
+      "eval_runtime": 56.4468,
+      "eval_samples_per_second": 51.783,
+      "eval_steps_per_second": 3.242,
+      "step": 3000
+    },
+    {
+      "epoch": 6.37,
+      "learning_rate": 7.963320463320465e-06,
+      "loss": 2.1038,
+      "step": 3300
+    },
+    {
+      "epoch": 6.95,
+      "learning_rate": 8.687258687258689e-06,
+      "loss": 2.1021,
+      "step": 3600
+    },
+    {
+      "epoch": 7.53,
+      "learning_rate": 9.41119691119691e-06,
+      "loss": 2.0882,
+      "step": 3900
+    },
+    {
+      "epoch": 7.72,
+      "eval_loss": 2.08085298538208,
+      "eval_runtime": 56.4755,
+      "eval_samples_per_second": 51.757,
+      "eval_steps_per_second": 3.24,
+      "step": 4000
+    },
+    {
+      "epoch": 8.11,
+      "learning_rate": 9.99549483102341e-06,
+      "loss": 2.0834,
+      "step": 4200
+    },
+    {
+      "epoch": 8.69,
+      "learning_rate": 9.819006680234513e-06,
+      "loss": 2.0744,
+      "step": 4500
+    },
+    {
+      "epoch": 9.27,
+      "learning_rate": 9.394326698914229e-06,
+      "loss": 2.0565,
+      "step": 4800
+    },
+    {
+      "epoch": 9.65,
+      "eval_loss": 2.062009811401367,
+      "eval_runtime": 56.2872,
+      "eval_samples_per_second": 51.93,
+      "eval_steps_per_second": 3.251,
+      "step": 5000
+    },
+    {
+      "epoch": 9.85,
+      "learning_rate": 8.743327050549326e-06,
+      "loss": 2.0622,
+      "step": 5100
+    },
+    {
+      "epoch": 10.42,
+      "learning_rate": 7.899535971376881e-06,
+      "loss": 2.0509,
+      "step": 5400
+    },
+    {
+      "epoch": 11.0,
+      "learning_rate": 6.906410975864522e-06,
+      "loss": 2.0494,
+      "step": 5700
+    },
+    {
+      "epoch": 11.58,
+      "learning_rate": 5.815100677603854e-06,
+      "loss": 2.0405,
+      "step": 6000
+    },
+    {
+      "epoch": 11.58,
+      "eval_loss": 2.0517830848693848,
+      "eval_runtime": 56.5476,
+      "eval_samples_per_second": 51.691,
+      "eval_steps_per_second": 3.236,
+      "step": 6000
+    }
+  ],
+  "logging_steps": 300,
+  "max_steps": 8288,
+  "num_train_epochs": 16,
+  "save_steps": 1000,
+  "total_flos": 5.200194349388022e+17,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-6000/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e3f853383e8dce9f00867dad3f3b4917bf63575060d38b299cdecb6532211b41
+size 4536