Files
OGAAA/Codes/3-2_model_training/_tune.ipynb
HenryChou020514 6edf7da2b7 first commit
2026-07-07 19:03:00 +08:00

1598 lines
72 KiB
Plaintext
Raw Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

{
"cells": [
{
"cell_type": "code",
"execution_count": 1,
"id": "94f47e49-b4d8-4816-90e6-441baa97223a",
"metadata": {},
"outputs": [
{
"name": "stderr",
"output_type": "stream",
"text": [
"/opt/miniconda/envs/focallora4/lib/python3.12/site-packages/tqdm/auto.py:21: TqdmWarning: IProgress not found. Please update jupyter and ipywidgets. See https://ipywidgets.readthedocs.io/en/stable/user_install.html\n",
" from .autonotebook import tqdm as notebook_tqdm\n"
]
},
{
"name": "stdout",
"output_type": "stream",
"text": [
"🥷 Injecting Spy Interceptor into Flash Attention 2...\n",
"✅ Spy Interceptor installed successfully!\n"
]
}
],
"source": [
"\n",
"import os\n",
"import json\n",
"import csv\n",
"import argparse\n",
"import math\n",
"import random\n",
"import re\n",
"from typing import List, Tuple, Dict\n",
"\n",
"import torch\n",
"import numpy as np\n",
"from tqdm import tqdm\n",
"from torch.utils.data import Dataset, DataLoader\n",
"from evallib import quick_eval_mmlu, quick_eval_asr_util\n",
"from transformers import (\n",
" AutoConfig, AutoTokenizer, AutoModelForCausalLM,\n",
" BitsAndBytesConfig, get_linear_schedule_with_warmup,\n",
")\n",
"from transformers.models.llama.modeling_llama import ALL_ATTENTION_FUNCTIONS\n",
"from peft import LoraConfig, get_peft_model, prepare_model_for_kbit_training, PeftModel\n",
"from lib.tokenize_data_mask import apply_chat_tokenize_with_strip_and_mark\n",
"from lib.printcolor import print_tok_color\n",
"# -----------------------------------------------------------------------------\n",
"# 1. Flash Attention Spy Interceptor (核心機制)\n",
"# -----------------------------------------------------------------------------\n",
"print(\"🥷 Injecting Spy Interceptor into Flash Attention 2...\")\n",
"\n",
"if \"flash_attention_2\" not in ALL_ATTENTION_FUNCTIONS:\n",
" raise RuntimeError(\"Current environment does not support Flash Attention 2!\")\n",
"\n",
"orig_flash_attn = ALL_ATTENTION_FUNCTIONS[\"flash_attention_2\"]\n",
"\n",
"def wrapped_flash_attn(module, query, key, value, attention_mask, scaling, **kwargs):\n",
" \"\"\"\n",
" 攔截 Flash Attention並在 Breakpoint 驗證手算結果與原始 FA2 結果的一致性。\n",
" \"\"\"\n",
" # -------------------------------------------------------------------------\n",
" # [TASK A] 間諜行動:偷算 Last Token Weight\n",
" # -------------------------------------------------------------------------\n",
" # 1. 切片 (只看最後一個 Token)\n",
" q_last = query[..., -1:, :] \n",
" \n",
" # 2. 處理 GQA (手動 Expand Key 和 Value)\n",
" num_heads = query.shape[1]\n",
" num_kv_heads = key.shape[1]\n",
" \n",
" # 用於後面計算 Manual Output\n",
" k_expanded = key\n",
" v_expanded = value \n",
"\n",
" if num_heads != num_kv_heads:\n",
" n_rep = num_heads // num_kv_heads\n",
" k_expanded = key.repeat_interleave(n_rep, dim=1)\n",
" v_expanded = value.repeat_interleave(n_rep, dim=1) # Value 也要 Expand 才能乘\n",
" \n",
" # 3. 手動計算 Tiny Attention Weight [Batch, Heads, 1, Seq]\n",
" # Q: [B, H, 1, D], K: [B, H, S, D] -> QK^T: [B, H, 1, S]\n",
" attn_weights_tiny = torch.matmul(q_last, k_expanded.transpose(2, 3)) * scaling\n",
" \n",
" # 4. 處理 Mask\n",
" if attention_mask is not None:\n",
" if attention_mask.dim() == 4:\n",
" if attention_mask.size(2) > 1:\n",
" mask_slice = attention_mask[..., -1:, :]\n",
" attn_weights_tiny = attn_weights_tiny + mask_slice\n",
" else:\n",
" attn_weights_tiny = attn_weights_tiny + attention_mask\n",
" elif attention_mask.dim() == 2:\n",
" mask_expanded = attention_mask[:, None, None, :]\n",
" if attention_mask.dtype == torch.bool or (attention_mask.max() <= 1.0 and attention_mask.min() >= 0.0):\n",
" min_dtype = torch.finfo(attn_weights_tiny.dtype).min\n",
" attn_weights_tiny = attn_weights_tiny.masked_fill(mask_expanded == 0, min_dtype)\n",
" else:\n",
" attn_weights_tiny = attn_weights_tiny + mask_expanded\n",
" \n",
" # 5. Softmax (得到機率分佈 P)\n",
" # 注意:這裡轉成 float32 做 softmax 以求精確,實際 FA2 內部可能是 fp16/bf16\n",
" attn_probs = torch.nn.functional.softmax(attn_weights_tiny, dim=-1, dtype=torch.float32).to(query.dtype)\n",
"\n",
" # 填入 Config (原本的邏輯)\n",
" retrieve_map = getattr(module.config, \"retrieve_attn_map\", None)\n",
" if retrieve_map is not None and hasattr(module, \"layer_idx\") and module.layer_idx in retrieve_map:\n",
" target_heads_dict = retrieve_map[module.layer_idx]\n",
" for h_idx in target_heads_dict.keys():\n",
" # 存入 config 用於 Loss 計算\n",
" target_heads_dict[h_idx] = attn_probs[:, h_idx, :, :]\n",
"\n",
" # -------------------------------------------------------------------------\n",
" # [DEBUG] 驗證環節:手算 Output vs Flash Attention Output\n",
" # -------------------------------------------------------------------------\n",
" \n",
" # 1. 執行原始 Flash Attention\n",
" orig_result = orig_flash_attn(module, query, key, value, attention_mask, scaling=scaling, **kwargs)\n",
" debug=False\n",
" if debug:\n",
" orig_tensor = orig_result[0]\n",
" # 2. 手動計算 Output ( O = Attention_Probs * V )\n",
" # attn_probs: [B, H, 1, S]\n",
" # v_expanded: [B, H, S, D]\n",
" # manual_out: [B, H, 1, D]\n",
" manual_out = torch.matmul(attn_probs, v_expanded)\n",
" \n",
" # 3. 對齊形狀以便比較\n",
" # FA2 output 通常是 [Batch, Seq, Heads, Dim]\n",
" # 我們取最後一個 token: [Batch, 1, Heads, Dim]\n",
" orig_out_last = orig_tensor[:, -1:, :, :]\n",
" \n",
" # 手算結果原本是 [Batch, Heads, 1, Dim],轉置成 [Batch, 1, Heads, Dim]\n",
" manual_out_check = manual_out.transpose(1, 2)\n",
" \n",
" # 4. 計算誤差\n",
" diff = (orig_out_last - manual_out_check).abs()\n",
" max_diff = diff.max().item()\n",
" mean_diff = diff.mean().item()\n",
" \n",
" print(f\"\\n🕵 [Layer {getattr(module, 'layer_idx', '?')}] Validation:\")\n",
" print(f\" Max Diff: {max_diff:.8f}\")\n",
" print(f\" Mean Diff: {mean_diff:.8f}\")\n",
" \n",
" # 如果誤差過大 (例如 > 1e-3),自動暫停檢查\n",
" # 注意BF16 下 FlashAttention 和標準 Matmul 會有一定精度差異是正常的\n",
" if max_diff > 1e-2: \n",
" print(\"⚠️ Warning: Large difference detected!\")\n",
" \n",
" # 呼叫 breakpoint 讓你進去檢查\n",
" # 在 pdb 輸入: \n",
" # p manual_out_check[0,0,0,:5] \n",
" # p orig_out_last[0,0,0,:5]\n",
" # 來對比數值\n",
" breakpoint() \n",
"\n",
" return orig_result\n",
"\n",
"# 替換全局函數\n",
"ALL_ATTENTION_FUNCTIONS[\"flash_attention_2\"] = wrapped_flash_attn\n",
"print(\"✅ Spy Interceptor installed successfully!\")"
]
},
{
"cell_type": "code",
"execution_count": 2,
"id": "7e2904a3-3abf-44b0-9d78-43710a3c4d62",
"metadata": {},
"outputs": [],
"source": [
"SEED = 42\n",
"random.seed(SEED)\n",
"np.random.seed(SEED)\n",
"torch.manual_seed(SEED)\n",
"\n",
"def get_lora_targets(model, layers: List[int]) -> List[str]:\n",
" mtype = (getattr(model.config, \"model_type\", \"\") or \"\").lower()\n",
" if \"llama\" in mtype or \"mistral\" in mtype:\n",
" return [f\"model.layers.{i}.self_attn.{p}\" for i in layers for p in (\"q_proj\", \"k_proj\")]\n",
" # Fallback / Other architectures\n",
" cand = []\n",
" for name, _ in model.named_modules():\n",
" if any(f\".{i}.\" in name for i in layers) and name.split(\".\")[-1] in {\"q_proj\", \"k_proj\"}:\n",
" cand.append(name)\n",
" return cand\n",
"\n",
"def load_model(model_path: str):\n",
" cfg = AutoConfig.from_pretrained(model_path, trust_remote_code=True)\n",
" tok = AutoTokenizer.from_pretrained(model_path, trust_remote_code=True, use_fast=True,padding_side=\"left\")\n",
" \n",
" if tok.pad_token_id is None:\n",
" tok.pad_token = tok.eos_token\n",
" tok.pad_token_id = tok.eos_token_id\n",
" \n",
" bnb_cfg = BitsAndBytesConfig(\n",
" load_in_4bit=True,\n",
" bnb_4bit_compute_dtype=torch.float16,\n",
" bnb_4bit_use_double_quant=True,\n",
" bnb_4bit_quant_type=\"nf4\",\n",
" )\n",
" model = AutoModelForCausalLM.from_pretrained(\n",
" model_path,\n",
" config=cfg,\n",
" quantization_config=bnb_cfg,\n",
" device_map=\"auto\",\n",
" trust_remote_code=True,\n",
" attn_implementation=\"flash_attention_2\",\n",
" )\n",
" return model, tok, tok # use same tokenizer for simplicity"
]
},
{
"cell_type": "code",
"execution_count": 3,
"id": "28290215-6860-4220-a02b-35e882da579a",
"metadata": {},
"outputs": [],
"source": [
"def get_target_structure(heads_file: str, topk_spec: str) -> Dict[int, List[int]]:\n",
" \"\"\"Load heads from file and parse into {layer: [heads]} structure.\"\"\"\n",
" if not os.path.exists(heads_file):\n",
" raise FileNotFoundError(f\"Heads file not found: {heads_file}\")\n",
" \n",
" with open(heads_file, \"r\") as f:\n",
" ihead_list = json.load(f)\n",
" if type(ihead_list[0]) == str:\n",
" all_heads = [(str(tag), 0.0) for tag in ihead_list]\n",
" else:\n",
" all_heads = ihead_list\n",
" \n",
" # Filter Top-K\n",
" count = len(all_heads)\n",
" if topk_spec.endswith(\"p\"):\n",
" count = max(1, math.ceil(float(topk_spec[:-1]) / 100.0 * len(all_heads)))\n",
" else:\n",
" count = int(topk_spec)\n",
" \n",
" target_heads = all_heads[:min(count, len(all_heads))]\n",
" \n",
" # Parse into structure\n",
" structure = {}\n",
" for tag, _ in target_heads:\n",
" try:\n",
" # tag format: \"L22_H7\"\n",
" parts = tag.split('_')\n",
" l = int(parts[0][1:])\n",
" h = int(parts[1][1:])\n",
" structure.setdefault(l, []).append(h)\n",
" except Exception:\n",
" continue\n",
" \n",
" print(f\"🎯 Selected {len(target_heads)} heads from {topk_spec}.\")\n",
" return structure"
]
},
{
"cell_type": "code",
"execution_count": 4,
"id": "211437db-b128-4d9c-8251-d38b43e3bb35",
"metadata": {},
"outputs": [
{
"name": "stdout",
"output_type": "stream",
"text": [
"🎯 Selected 223 heads from 21.75p.\n"
]
}
],
"source": [
"model_path = \"/data/local/models/Qwen3-8B\"\n",
"head_path=\"/data/local/hujk/ISH/head_scoring/qwen3-8b_sep/heads_sorted/all_roc_inst_0.1.json\"\n",
"\n",
"model_path = \"/data/local/models/Llama-3.1-8B-Instruct\"\n",
"head_path=\"/data/local/hujk/ISH/head_scoring/llama31-8b_sep/heads_sorted/all_roc_inst_0.1.json\"\n",
"target_heads = get_target_structure(head_path,\"21.75p\")\n"
]
},
{
"cell_type": "code",
"execution_count": 6,
"id": "44d6094d-74e8-47a1-bac7-fa012b90ede7",
"metadata": {},
"outputs": [
{
"data": {
"text/plain": [
"{13: [7,\n",
" 14,\n",
" 8,\n",
" 13,\n",
" 29,\n",
" 22,\n",
" 20,\n",
" 10,\n",
" 6,\n",
" 9,\n",
" 19,\n",
" 2,\n",
" 24,\n",
" 28,\n",
" 26,\n",
" 16,\n",
" 0,\n",
" 25,\n",
" 12,\n",
" 23,\n",
" 17],\n",
" 16: [3, 16, 4, 22, 14, 6, 17, 27, 24, 19, 15, 12, 5, 25],\n",
" 9: [24, 26, 31, 27, 22, 20, 13, 12, 29, 28, 30, 18, 1, 9, 2, 23],\n",
" 15: [23, 12, 14, 21, 27, 15, 5, 10, 29, 0, 13, 22, 3, 20, 24, 16, 6, 8],\n",
" 17: [31, 20, 30, 25, 22, 21, 7, 27, 14, 4, 28, 13, 5],\n",
" 14: [29, 7, 13, 3, 6, 23, 0, 28, 18, 1, 24, 10, 12, 14, 2, 15, 21, 27],\n",
" 5: [29, 4, 15, 30, 31, 3, 16, 17, 25],\n",
" 12: [9, 24, 26, 4, 30, 15, 31, 16, 8, 21, 27, 25, 11, 10, 22, 28, 0, 23],\n",
" 7: [14, 9, 28, 31, 11, 10, 17, 8, 29, 18, 24, 12, 23],\n",
" 8: [25, 4, 15, 31, 13, 24, 19, 30, 27, 20, 8],\n",
" 18: [25, 29, 11, 10, 28, 24, 27, 19, 17, 12, 5, 18, 0, 2, 9],\n",
" 6: [7, 29, 22, 30, 20, 13, 0, 4],\n",
" 10: [11, 20, 24, 19, 9, 0, 16, 30, 18, 1, 22, 25, 21, 13, 17, 23, 10],\n",
" 19: [21, 20, 3, 22],\n",
" 11: [23, 25, 9, 26, 21, 24, 10, 27, 11, 6],\n",
" 20: [30, 23, 0, 9, 21, 24, 15],\n",
" 22: [9, 4, 17],\n",
" 4: [15, 31, 4],\n",
" 26: [2],\n",
" 21: [8],\n",
" 3: [30, 28],\n",
" 23: [17]}"
]
},
"execution_count": 6,
"metadata": {},
"output_type": "execute_result"
}
],
"source": [
"target_heads"
]
},
{
"cell_type": "code",
"execution_count": 5,
"id": "f1bbf423-65a8-401f-ad5a-8a644bc53952",
"metadata": {},
"outputs": [
{
"name": "stderr",
"output_type": "stream",
"text": [
"Loading checkpoint shards: 100% 4/4 [00:12<00:00, 3.21s/it]\n"
]
}
],
"source": [
"model, tok, tok2 = load_model(model_path)"
]
},
{
"cell_type": "code",
"execution_count": 7,
"id": "66dda564-e757-4784-9a72-48e2add45151",
"metadata": {},
"outputs": [],
"source": [
"def get_lora_targets(model, layers: List[int]) -> List[str]:\n",
" mtype = (getattr(model.config, \"model_type\", \"\") or \"\").lower()\n",
" if \"llama\" in mtype or \"mistral\" in mtype:\n",
" return [f\"model.layers.{i}.self_attn.{p}\" for i in layers for p in (\"q_proj\", \"k_proj\")]\n",
" # Fallback / Other architectures\n",
" cand = []\n",
" for name, _ in model.named_modules():\n",
" if any(f\".{i}.\" in name for i in layers) and name.split(\".\")[-1] in {\"q_proj\", \"k_proj\"}:\n",
" cand.append(name)\n",
" return cand"
]
},
{
"cell_type": "code",
"execution_count": 9,
"id": "f4a9304c-0e5c-4c8d-b270-0cbc4f20e3bd",
"metadata": {},
"outputs": [],
"source": [
"ls =get_lora_targets(model,target_heads)"
]
},
{
"cell_type": "code",
"execution_count": 10,
"id": "27374e33-9478-489b-a4a6-14a51644a445",
"metadata": {},
"outputs": [
{
"data": {
"text/plain": [
"['model.layers.10.self_attn.k_proj',\n",
" 'model.layers.10.self_attn.q_proj',\n",
" 'model.layers.11.self_attn.k_proj',\n",
" 'model.layers.11.self_attn.q_proj',\n",
" 'model.layers.12.self_attn.k_proj',\n",
" 'model.layers.12.self_attn.q_proj',\n",
" 'model.layers.13.self_attn.k_proj',\n",
" 'model.layers.13.self_attn.q_proj',\n",
" 'model.layers.14.self_attn.k_proj',\n",
" 'model.layers.14.self_attn.q_proj',\n",
" 'model.layers.15.self_attn.k_proj',\n",
" 'model.layers.15.self_attn.q_proj',\n",
" 'model.layers.16.self_attn.k_proj',\n",
" 'model.layers.16.self_attn.q_proj',\n",
" 'model.layers.17.self_attn.k_proj',\n",
" 'model.layers.17.self_attn.q_proj',\n",
" 'model.layers.18.self_attn.k_proj',\n",
" 'model.layers.18.self_attn.q_proj',\n",
" 'model.layers.19.self_attn.k_proj',\n",
" 'model.layers.19.self_attn.q_proj',\n",
" 'model.layers.20.self_attn.k_proj',\n",
" 'model.layers.20.self_attn.q_proj',\n",
" 'model.layers.21.self_attn.k_proj',\n",
" 'model.layers.21.self_attn.q_proj',\n",
" 'model.layers.22.self_attn.k_proj',\n",
" 'model.layers.22.self_attn.q_proj',\n",
" 'model.layers.23.self_attn.k_proj',\n",
" 'model.layers.23.self_attn.q_proj',\n",
" 'model.layers.26.self_attn.k_proj',\n",
" 'model.layers.26.self_attn.q_proj',\n",
" 'model.layers.3.self_attn.k_proj',\n",
" 'model.layers.3.self_attn.q_proj',\n",
" 'model.layers.4.self_attn.k_proj',\n",
" 'model.layers.4.self_attn.q_proj',\n",
" 'model.layers.5.self_attn.k_proj',\n",
" 'model.layers.5.self_attn.q_proj',\n",
" 'model.layers.6.self_attn.k_proj',\n",
" 'model.layers.6.self_attn.q_proj',\n",
" 'model.layers.7.self_attn.k_proj',\n",
" 'model.layers.7.self_attn.q_proj',\n",
" 'model.layers.8.self_attn.k_proj',\n",
" 'model.layers.8.self_attn.q_proj',\n",
" 'model.layers.9.self_attn.k_proj',\n",
" 'model.layers.9.self_attn.q_proj']"
]
},
"execution_count": 10,
"metadata": {},
"output_type": "execute_result"
}
],
"source": [
"sorted(ls)"
]
},
{
"cell_type": "code",
"execution_count": 22,
"id": "62ce6fe8-1a01-4dd6-a682-830e12eb7c11",
"metadata": {},
"outputs": [
{
"name": "stdout",
"output_type": "stream",
"text": [
"0:===========================================\n",
"\n",
"1:===========================================\n",
"model\n",
"2:===========================================\n",
"model.embed_tokens\n",
"3:===========================================\n",
"model.layers\n",
"4:===========================================\n",
"model.layers.0\n",
"5:===========================================\n",
"model.layers.0.self_attn\n",
"6:===========================================\n",
"model.layers.0.self_attn.q_proj\n",
"7:===========================================\n",
"model.layers.0.self_attn.k_proj\n",
"8:===========================================\n",
"model.layers.0.self_attn.v_proj\n",
"9:===========================================\n",
"model.layers.0.self_attn.o_proj\n",
"10:===========================================\n",
"model.layers.0.self_attn.q_norm\n",
"11:===========================================\n",
"model.layers.0.self_attn.k_norm\n",
"12:===========================================\n",
"model.layers.0.mlp\n",
"13:===========================================\n",
"model.layers.0.mlp.gate_proj\n",
"14:===========================================\n",
"model.layers.0.mlp.up_proj\n",
"15:===========================================\n",
"model.layers.0.mlp.down_proj\n",
"16:===========================================\n",
"model.layers.0.mlp.act_fn\n",
"17:===========================================\n",
"model.layers.0.input_layernorm\n",
"18:===========================================\n",
"model.layers.0.post_attention_layernorm\n",
"19:===========================================\n",
"model.layers.1\n",
"20:===========================================\n",
"model.layers.1.self_attn\n",
"21:===========================================\n",
"model.layers.1.self_attn.q_proj\n",
"22:===========================================\n",
"model.layers.1.self_attn.k_proj\n",
"23:===========================================\n",
"model.layers.1.self_attn.v_proj\n",
"24:===========================================\n",
"model.layers.1.self_attn.o_proj\n",
"25:===========================================\n",
"model.layers.1.self_attn.q_norm\n",
"26:===========================================\n",
"model.layers.1.self_attn.k_norm\n",
"27:===========================================\n",
"model.layers.1.mlp\n",
"28:===========================================\n",
"model.layers.1.mlp.gate_proj\n",
"29:===========================================\n",
"model.layers.1.mlp.up_proj\n",
"30:===========================================\n",
"model.layers.1.mlp.down_proj\n",
"31:===========================================\n",
"model.layers.1.mlp.act_fn\n",
"32:===========================================\n",
"model.layers.1.input_layernorm\n",
"33:===========================================\n",
"model.layers.1.post_attention_layernorm\n",
"34:===========================================\n",
"model.layers.2\n",
"35:===========================================\n",
"model.layers.2.self_attn\n",
"36:===========================================\n",
"model.layers.2.self_attn.q_proj\n",
"37:===========================================\n",
"model.layers.2.self_attn.k_proj\n",
"38:===========================================\n",
"model.layers.2.self_attn.v_proj\n",
"39:===========================================\n",
"model.layers.2.self_attn.o_proj\n",
"40:===========================================\n",
"model.layers.2.self_attn.q_norm\n",
"41:===========================================\n",
"model.layers.2.self_attn.k_norm\n",
"42:===========================================\n",
"model.layers.2.mlp\n",
"43:===========================================\n",
"model.layers.2.mlp.gate_proj\n",
"44:===========================================\n",
"model.layers.2.mlp.up_proj\n",
"45:===========================================\n",
"model.layers.2.mlp.down_proj\n",
"46:===========================================\n",
"model.layers.2.mlp.act_fn\n",
"47:===========================================\n",
"model.layers.2.input_layernorm\n",
"48:===========================================\n",
"model.layers.2.post_attention_layernorm\n",
"49:===========================================\n",
"model.layers.3\n",
"50:===========================================\n",
"model.layers.3.self_attn\n",
"51:===========================================\n",
"model.layers.3.self_attn.q_proj\n",
"52:===========================================\n",
"model.layers.3.self_attn.k_proj\n",
"53:===========================================\n",
"model.layers.3.self_attn.v_proj\n",
"54:===========================================\n",
"model.layers.3.self_attn.o_proj\n",
"55:===========================================\n",
"model.layers.3.self_attn.q_norm\n",
"56:===========================================\n",
"model.layers.3.self_attn.k_norm\n",
"57:===========================================\n",
"model.layers.3.mlp\n",
"58:===========================================\n",
"model.layers.3.mlp.gate_proj\n",
"59:===========================================\n",
"model.layers.3.mlp.up_proj\n",
"60:===========================================\n",
"model.layers.3.mlp.down_proj\n",
"61:===========================================\n",
"model.layers.3.mlp.act_fn\n",
"62:===========================================\n",
"model.layers.3.input_layernorm\n",
"63:===========================================\n",
"model.layers.3.post_attention_layernorm\n",
"64:===========================================\n",
"model.layers.4\n",
"65:===========================================\n",
"model.layers.4.self_attn\n",
"66:===========================================\n",
"model.layers.4.self_attn.q_proj\n",
"67:===========================================\n",
"model.layers.4.self_attn.k_proj\n",
"68:===========================================\n",
"model.layers.4.self_attn.v_proj\n",
"69:===========================================\n",
"model.layers.4.self_attn.o_proj\n",
"70:===========================================\n",
"model.layers.4.self_attn.q_norm\n",
"71:===========================================\n",
"model.layers.4.self_attn.k_norm\n",
"72:===========================================\n",
"model.layers.4.mlp\n",
"73:===========================================\n",
"model.layers.4.mlp.gate_proj\n",
"74:===========================================\n",
"model.layers.4.mlp.up_proj\n",
"75:===========================================\n",
"model.layers.4.mlp.down_proj\n",
"76:===========================================\n",
"model.layers.4.mlp.act_fn\n",
"77:===========================================\n",
"model.layers.4.input_layernorm\n",
"78:===========================================\n",
"model.layers.4.post_attention_layernorm\n",
"79:===========================================\n",
"model.layers.5\n",
"80:===========================================\n",
"model.layers.5.self_attn\n",
"81:===========================================\n",
"model.layers.5.self_attn.q_proj\n",
"82:===========================================\n",
"model.layers.5.self_attn.k_proj\n",
"83:===========================================\n",
"model.layers.5.self_attn.v_proj\n",
"84:===========================================\n",
"model.layers.5.self_attn.o_proj\n",
"85:===========================================\n",
"model.layers.5.self_attn.q_norm\n",
"86:===========================================\n",
"model.layers.5.self_attn.k_norm\n",
"87:===========================================\n",
"model.layers.5.mlp\n",
"88:===========================================\n",
"model.layers.5.mlp.gate_proj\n",
"89:===========================================\n",
"model.layers.5.mlp.up_proj\n",
"90:===========================================\n",
"model.layers.5.mlp.down_proj\n",
"91:===========================================\n",
"model.layers.5.mlp.act_fn\n",
"92:===========================================\n",
"model.layers.5.input_layernorm\n",
"93:===========================================\n",
"model.layers.5.post_attention_layernorm\n",
"94:===========================================\n",
"model.layers.6\n",
"95:===========================================\n",
"model.layers.6.self_attn\n",
"96:===========================================\n",
"model.layers.6.self_attn.q_proj\n",
"97:===========================================\n",
"model.layers.6.self_attn.k_proj\n",
"98:===========================================\n",
"model.layers.6.self_attn.v_proj\n",
"99:===========================================\n",
"model.layers.6.self_attn.o_proj\n",
"100:===========================================\n",
"model.layers.6.self_attn.q_norm\n",
"101:===========================================\n",
"model.layers.6.self_attn.k_norm\n",
"102:===========================================\n",
"model.layers.6.mlp\n",
"103:===========================================\n",
"model.layers.6.mlp.gate_proj\n",
"104:===========================================\n",
"model.layers.6.mlp.up_proj\n",
"105:===========================================\n",
"model.layers.6.mlp.down_proj\n",
"106:===========================================\n",
"model.layers.6.mlp.act_fn\n",
"107:===========================================\n",
"model.layers.6.input_layernorm\n",
"108:===========================================\n",
"model.layers.6.post_attention_layernorm\n",
"109:===========================================\n",
"model.layers.7\n",
"110:===========================================\n",
"model.layers.7.self_attn\n",
"111:===========================================\n",
"model.layers.7.self_attn.q_proj\n",
"112:===========================================\n",
"model.layers.7.self_attn.k_proj\n",
"113:===========================================\n",
"model.layers.7.self_attn.v_proj\n",
"114:===========================================\n",
"model.layers.7.self_attn.o_proj\n",
"115:===========================================\n",
"model.layers.7.self_attn.q_norm\n",
"116:===========================================\n",
"model.layers.7.self_attn.k_norm\n",
"117:===========================================\n",
"model.layers.7.mlp\n",
"118:===========================================\n",
"model.layers.7.mlp.gate_proj\n",
"119:===========================================\n",
"model.layers.7.mlp.up_proj\n",
"120:===========================================\n",
"model.layers.7.mlp.down_proj\n",
"121:===========================================\n",
"model.layers.7.mlp.act_fn\n",
"122:===========================================\n",
"model.layers.7.input_layernorm\n",
"123:===========================================\n",
"model.layers.7.post_attention_layernorm\n",
"124:===========================================\n",
"model.layers.8\n",
"125:===========================================\n",
"model.layers.8.self_attn\n",
"126:===========================================\n",
"model.layers.8.self_attn.q_proj\n",
"127:===========================================\n",
"model.layers.8.self_attn.k_proj\n",
"128:===========================================\n",
"model.layers.8.self_attn.v_proj\n",
"129:===========================================\n",
"model.layers.8.self_attn.o_proj\n",
"130:===========================================\n",
"model.layers.8.self_attn.q_norm\n",
"131:===========================================\n",
"model.layers.8.self_attn.k_norm\n",
"132:===========================================\n",
"model.layers.8.mlp\n",
"133:===========================================\n",
"model.layers.8.mlp.gate_proj\n",
"134:===========================================\n",
"model.layers.8.mlp.up_proj\n",
"135:===========================================\n",
"model.layers.8.mlp.down_proj\n",
"136:===========================================\n",
"model.layers.8.mlp.act_fn\n",
"137:===========================================\n",
"model.layers.8.input_layernorm\n",
"138:===========================================\n",
"model.layers.8.post_attention_layernorm\n",
"139:===========================================\n",
"model.layers.9\n",
"140:===========================================\n",
"model.layers.9.self_attn\n",
"141:===========================================\n",
"model.layers.9.self_attn.q_proj\n",
"142:===========================================\n",
"model.layers.9.self_attn.k_proj\n",
"143:===========================================\n",
"model.layers.9.self_attn.v_proj\n",
"144:===========================================\n",
"model.layers.9.self_attn.o_proj\n",
"145:===========================================\n",
"model.layers.9.self_attn.q_norm\n",
"146:===========================================\n",
"model.layers.9.self_attn.k_norm\n",
"147:===========================================\n",
"model.layers.9.mlp\n",
"148:===========================================\n",
"model.layers.9.mlp.gate_proj\n",
"149:===========================================\n",
"model.layers.9.mlp.up_proj\n",
"150:===========================================\n",
"model.layers.9.mlp.down_proj\n",
"151:===========================================\n",
"model.layers.9.mlp.act_fn\n",
"152:===========================================\n",
"model.layers.9.input_layernorm\n",
"153:===========================================\n",
"model.layers.9.post_attention_layernorm\n",
"154:===========================================\n",
"model.layers.10\n",
"155:===========================================\n",
"model.layers.10.self_attn\n",
"156:===========================================\n",
"model.layers.10.self_attn.q_proj\n",
"157:===========================================\n",
"model.layers.10.self_attn.k_proj\n",
"158:===========================================\n",
"model.layers.10.self_attn.v_proj\n",
"159:===========================================\n",
"model.layers.10.self_attn.o_proj\n",
"160:===========================================\n",
"model.layers.10.self_attn.q_norm\n",
"161:===========================================\n",
"model.layers.10.self_attn.k_norm\n",
"162:===========================================\n",
"model.layers.10.mlp\n",
"163:===========================================\n",
"model.layers.10.mlp.gate_proj\n",
"164:===========================================\n",
"model.layers.10.mlp.up_proj\n",
"165:===========================================\n",
"model.layers.10.mlp.down_proj\n",
"166:===========================================\n",
"model.layers.10.mlp.act_fn\n",
"167:===========================================\n",
"model.layers.10.input_layernorm\n",
"168:===========================================\n",
"model.layers.10.post_attention_layernorm\n",
"169:===========================================\n",
"model.layers.11\n",
"170:===========================================\n",
"model.layers.11.self_attn\n",
"171:===========================================\n",
"model.layers.11.self_attn.q_proj\n",
"172:===========================================\n",
"model.layers.11.self_attn.k_proj\n",
"173:===========================================\n",
"model.layers.11.self_attn.v_proj\n",
"174:===========================================\n",
"model.layers.11.self_attn.o_proj\n",
"175:===========================================\n",
"model.layers.11.self_attn.q_norm\n",
"176:===========================================\n",
"model.layers.11.self_attn.k_norm\n",
"177:===========================================\n",
"model.layers.11.mlp\n",
"178:===========================================\n",
"model.layers.11.mlp.gate_proj\n",
"179:===========================================\n",
"model.layers.11.mlp.up_proj\n",
"180:===========================================\n",
"model.layers.11.mlp.down_proj\n",
"181:===========================================\n",
"model.layers.11.mlp.act_fn\n",
"182:===========================================\n",
"model.layers.11.input_layernorm\n",
"183:===========================================\n",
"model.layers.11.post_attention_layernorm\n",
"184:===========================================\n",
"model.layers.12\n",
"185:===========================================\n",
"model.layers.12.self_attn\n",
"186:===========================================\n",
"model.layers.12.self_attn.q_proj\n",
"187:===========================================\n",
"model.layers.12.self_attn.k_proj\n",
"188:===========================================\n",
"model.layers.12.self_attn.v_proj\n",
"189:===========================================\n",
"model.layers.12.self_attn.o_proj\n",
"190:===========================================\n",
"model.layers.12.self_attn.q_norm\n",
"191:===========================================\n",
"model.layers.12.self_attn.k_norm\n",
"192:===========================================\n",
"model.layers.12.mlp\n",
"193:===========================================\n",
"model.layers.12.mlp.gate_proj\n",
"194:===========================================\n",
"model.layers.12.mlp.up_proj\n",
"195:===========================================\n",
"model.layers.12.mlp.down_proj\n",
"196:===========================================\n",
"model.layers.12.mlp.act_fn\n",
"197:===========================================\n",
"model.layers.12.input_layernorm\n",
"198:===========================================\n",
"model.layers.12.post_attention_layernorm\n",
"199:===========================================\n",
"model.layers.13\n",
"200:===========================================\n",
"model.layers.13.self_attn\n",
"201:===========================================\n",
"model.layers.13.self_attn.q_proj\n",
"202:===========================================\n",
"model.layers.13.self_attn.k_proj\n",
"203:===========================================\n",
"model.layers.13.self_attn.v_proj\n",
"204:===========================================\n",
"model.layers.13.self_attn.o_proj\n",
"205:===========================================\n",
"model.layers.13.self_attn.q_norm\n",
"206:===========================================\n",
"model.layers.13.self_attn.k_norm\n",
"207:===========================================\n",
"model.layers.13.mlp\n",
"208:===========================================\n",
"model.layers.13.mlp.gate_proj\n",
"209:===========================================\n",
"model.layers.13.mlp.up_proj\n",
"210:===========================================\n",
"model.layers.13.mlp.down_proj\n",
"211:===========================================\n",
"model.layers.13.mlp.act_fn\n",
"212:===========================================\n",
"model.layers.13.input_layernorm\n",
"213:===========================================\n",
"model.layers.13.post_attention_layernorm\n",
"214:===========================================\n",
"model.layers.14\n",
"215:===========================================\n",
"model.layers.14.self_attn\n",
"216:===========================================\n",
"model.layers.14.self_attn.q_proj\n",
"217:===========================================\n",
"model.layers.14.self_attn.k_proj\n",
"218:===========================================\n",
"model.layers.14.self_attn.v_proj\n",
"219:===========================================\n",
"model.layers.14.self_attn.o_proj\n",
"220:===========================================\n",
"model.layers.14.self_attn.q_norm\n",
"221:===========================================\n",
"model.layers.14.self_attn.k_norm\n",
"222:===========================================\n",
"model.layers.14.mlp\n",
"223:===========================================\n",
"model.layers.14.mlp.gate_proj\n",
"224:===========================================\n",
"model.layers.14.mlp.up_proj\n",
"225:===========================================\n",
"model.layers.14.mlp.down_proj\n",
"226:===========================================\n",
"model.layers.14.mlp.act_fn\n",
"227:===========================================\n",
"model.layers.14.input_layernorm\n",
"228:===========================================\n",
"model.layers.14.post_attention_layernorm\n",
"229:===========================================\n",
"model.layers.15\n",
"230:===========================================\n",
"model.layers.15.self_attn\n",
"231:===========================================\n",
"model.layers.15.self_attn.q_proj\n",
"232:===========================================\n",
"model.layers.15.self_attn.k_proj\n",
"233:===========================================\n",
"model.layers.15.self_attn.v_proj\n",
"234:===========================================\n",
"model.layers.15.self_attn.o_proj\n",
"235:===========================================\n",
"model.layers.15.self_attn.q_norm\n",
"236:===========================================\n",
"model.layers.15.self_attn.k_norm\n",
"237:===========================================\n",
"model.layers.15.mlp\n",
"238:===========================================\n",
"model.layers.15.mlp.gate_proj\n",
"239:===========================================\n",
"model.layers.15.mlp.up_proj\n",
"240:===========================================\n",
"model.layers.15.mlp.down_proj\n",
"241:===========================================\n",
"model.layers.15.mlp.act_fn\n",
"242:===========================================\n",
"model.layers.15.input_layernorm\n",
"243:===========================================\n",
"model.layers.15.post_attention_layernorm\n",
"244:===========================================\n",
"model.layers.16\n",
"245:===========================================\n",
"model.layers.16.self_attn\n",
"246:===========================================\n",
"model.layers.16.self_attn.q_proj\n",
"247:===========================================\n",
"model.layers.16.self_attn.k_proj\n",
"248:===========================================\n",
"model.layers.16.self_attn.v_proj\n",
"249:===========================================\n",
"model.layers.16.self_attn.o_proj\n",
"250:===========================================\n",
"model.layers.16.self_attn.q_norm\n",
"251:===========================================\n",
"model.layers.16.self_attn.k_norm\n",
"252:===========================================\n",
"model.layers.16.mlp\n",
"253:===========================================\n",
"model.layers.16.mlp.gate_proj\n",
"254:===========================================\n",
"model.layers.16.mlp.up_proj\n",
"255:===========================================\n",
"model.layers.16.mlp.down_proj\n",
"256:===========================================\n",
"model.layers.16.mlp.act_fn\n",
"257:===========================================\n",
"model.layers.16.input_layernorm\n",
"258:===========================================\n",
"model.layers.16.post_attention_layernorm\n",
"259:===========================================\n",
"model.layers.17\n",
"260:===========================================\n",
"model.layers.17.self_attn\n",
"261:===========================================\n",
"model.layers.17.self_attn.q_proj\n",
"262:===========================================\n",
"model.layers.17.self_attn.k_proj\n",
"263:===========================================\n",
"model.layers.17.self_attn.v_proj\n",
"264:===========================================\n",
"model.layers.17.self_attn.o_proj\n",
"265:===========================================\n",
"model.layers.17.self_attn.q_norm\n",
"266:===========================================\n",
"model.layers.17.self_attn.k_norm\n",
"267:===========================================\n",
"model.layers.17.mlp\n",
"268:===========================================\n",
"model.layers.17.mlp.gate_proj\n",
"269:===========================================\n",
"model.layers.17.mlp.up_proj\n",
"270:===========================================\n",
"model.layers.17.mlp.down_proj\n",
"271:===========================================\n",
"model.layers.17.mlp.act_fn\n",
"272:===========================================\n",
"model.layers.17.input_layernorm\n",
"273:===========================================\n",
"model.layers.17.post_attention_layernorm\n",
"274:===========================================\n",
"model.layers.18\n",
"275:===========================================\n",
"model.layers.18.self_attn\n",
"276:===========================================\n",
"model.layers.18.self_attn.q_proj\n",
"277:===========================================\n",
"model.layers.18.self_attn.k_proj\n",
"278:===========================================\n",
"model.layers.18.self_attn.v_proj\n",
"279:===========================================\n",
"model.layers.18.self_attn.o_proj\n",
"280:===========================================\n",
"model.layers.18.self_attn.q_norm\n",
"281:===========================================\n",
"model.layers.18.self_attn.k_norm\n",
"282:===========================================\n",
"model.layers.18.mlp\n",
"283:===========================================\n",
"model.layers.18.mlp.gate_proj\n",
"284:===========================================\n",
"model.layers.18.mlp.up_proj\n",
"285:===========================================\n",
"model.layers.18.mlp.down_proj\n",
"286:===========================================\n",
"model.layers.18.mlp.act_fn\n",
"287:===========================================\n",
"model.layers.18.input_layernorm\n",
"288:===========================================\n",
"model.layers.18.post_attention_layernorm\n",
"289:===========================================\n",
"model.layers.19\n",
"290:===========================================\n",
"model.layers.19.self_attn\n",
"291:===========================================\n",
"model.layers.19.self_attn.q_proj\n",
"292:===========================================\n",
"model.layers.19.self_attn.k_proj\n",
"293:===========================================\n",
"model.layers.19.self_attn.v_proj\n",
"294:===========================================\n",
"model.layers.19.self_attn.o_proj\n",
"295:===========================================\n",
"model.layers.19.self_attn.q_norm\n",
"296:===========================================\n",
"model.layers.19.self_attn.k_norm\n",
"297:===========================================\n",
"model.layers.19.mlp\n",
"298:===========================================\n",
"model.layers.19.mlp.gate_proj\n",
"299:===========================================\n",
"model.layers.19.mlp.up_proj\n",
"300:===========================================\n",
"model.layers.19.mlp.down_proj\n",
"301:===========================================\n",
"model.layers.19.mlp.act_fn\n",
"302:===========================================\n",
"model.layers.19.input_layernorm\n",
"303:===========================================\n",
"model.layers.19.post_attention_layernorm\n",
"304:===========================================\n",
"model.layers.20\n",
"305:===========================================\n",
"model.layers.20.self_attn\n",
"306:===========================================\n",
"model.layers.20.self_attn.q_proj\n",
"307:===========================================\n",
"model.layers.20.self_attn.k_proj\n",
"308:===========================================\n",
"model.layers.20.self_attn.v_proj\n",
"309:===========================================\n",
"model.layers.20.self_attn.o_proj\n",
"310:===========================================\n",
"model.layers.20.self_attn.q_norm\n",
"311:===========================================\n",
"model.layers.20.self_attn.k_norm\n",
"312:===========================================\n",
"model.layers.20.mlp\n",
"313:===========================================\n",
"model.layers.20.mlp.gate_proj\n",
"314:===========================================\n",
"model.layers.20.mlp.up_proj\n",
"315:===========================================\n",
"model.layers.20.mlp.down_proj\n",
"316:===========================================\n",
"model.layers.20.mlp.act_fn\n",
"317:===========================================\n",
"model.layers.20.input_layernorm\n",
"318:===========================================\n",
"model.layers.20.post_attention_layernorm\n",
"319:===========================================\n",
"model.layers.21\n",
"320:===========================================\n",
"model.layers.21.self_attn\n",
"321:===========================================\n",
"model.layers.21.self_attn.q_proj\n",
"322:===========================================\n",
"model.layers.21.self_attn.k_proj\n",
"323:===========================================\n",
"model.layers.21.self_attn.v_proj\n",
"324:===========================================\n",
"model.layers.21.self_attn.o_proj\n",
"325:===========================================\n",
"model.layers.21.self_attn.q_norm\n",
"326:===========================================\n",
"model.layers.21.self_attn.k_norm\n",
"327:===========================================\n",
"model.layers.21.mlp\n",
"328:===========================================\n",
"model.layers.21.mlp.gate_proj\n",
"329:===========================================\n",
"model.layers.21.mlp.up_proj\n",
"330:===========================================\n",
"model.layers.21.mlp.down_proj\n",
"331:===========================================\n",
"model.layers.21.mlp.act_fn\n",
"332:===========================================\n",
"model.layers.21.input_layernorm\n",
"333:===========================================\n",
"model.layers.21.post_attention_layernorm\n",
"334:===========================================\n",
"model.layers.22\n",
"335:===========================================\n",
"model.layers.22.self_attn\n",
"336:===========================================\n",
"model.layers.22.self_attn.q_proj\n",
"337:===========================================\n",
"model.layers.22.self_attn.k_proj\n",
"338:===========================================\n",
"model.layers.22.self_attn.v_proj\n",
"339:===========================================\n",
"model.layers.22.self_attn.o_proj\n",
"340:===========================================\n",
"model.layers.22.self_attn.q_norm\n",
"341:===========================================\n",
"model.layers.22.self_attn.k_norm\n",
"342:===========================================\n",
"model.layers.22.mlp\n",
"343:===========================================\n",
"model.layers.22.mlp.gate_proj\n",
"344:===========================================\n",
"model.layers.22.mlp.up_proj\n",
"345:===========================================\n",
"model.layers.22.mlp.down_proj\n",
"346:===========================================\n",
"model.layers.22.mlp.act_fn\n",
"347:===========================================\n",
"model.layers.22.input_layernorm\n",
"348:===========================================\n",
"model.layers.22.post_attention_layernorm\n",
"349:===========================================\n",
"model.layers.23\n",
"350:===========================================\n",
"model.layers.23.self_attn\n",
"351:===========================================\n",
"model.layers.23.self_attn.q_proj\n",
"352:===========================================\n",
"model.layers.23.self_attn.k_proj\n",
"353:===========================================\n",
"model.layers.23.self_attn.v_proj\n",
"354:===========================================\n",
"model.layers.23.self_attn.o_proj\n",
"355:===========================================\n",
"model.layers.23.self_attn.q_norm\n",
"356:===========================================\n",
"model.layers.23.self_attn.k_norm\n",
"357:===========================================\n",
"model.layers.23.mlp\n",
"358:===========================================\n",
"model.layers.23.mlp.gate_proj\n",
"359:===========================================\n",
"model.layers.23.mlp.up_proj\n",
"360:===========================================\n",
"model.layers.23.mlp.down_proj\n",
"361:===========================================\n",
"model.layers.23.mlp.act_fn\n",
"362:===========================================\n",
"model.layers.23.input_layernorm\n",
"363:===========================================\n",
"model.layers.23.post_attention_layernorm\n",
"364:===========================================\n",
"model.layers.24\n",
"365:===========================================\n",
"model.layers.24.self_attn\n",
"366:===========================================\n",
"model.layers.24.self_attn.q_proj\n",
"367:===========================================\n",
"model.layers.24.self_attn.k_proj\n",
"368:===========================================\n",
"model.layers.24.self_attn.v_proj\n",
"369:===========================================\n",
"model.layers.24.self_attn.o_proj\n",
"370:===========================================\n",
"model.layers.24.self_attn.q_norm\n",
"371:===========================================\n",
"model.layers.24.self_attn.k_norm\n",
"372:===========================================\n",
"model.layers.24.mlp\n",
"373:===========================================\n",
"model.layers.24.mlp.gate_proj\n",
"374:===========================================\n",
"model.layers.24.mlp.up_proj\n",
"375:===========================================\n",
"model.layers.24.mlp.down_proj\n",
"376:===========================================\n",
"model.layers.24.mlp.act_fn\n",
"377:===========================================\n",
"model.layers.24.input_layernorm\n",
"378:===========================================\n",
"model.layers.24.post_attention_layernorm\n",
"379:===========================================\n",
"model.layers.25\n",
"380:===========================================\n",
"model.layers.25.self_attn\n",
"381:===========================================\n",
"model.layers.25.self_attn.q_proj\n",
"382:===========================================\n",
"model.layers.25.self_attn.k_proj\n",
"383:===========================================\n",
"model.layers.25.self_attn.v_proj\n",
"384:===========================================\n",
"model.layers.25.self_attn.o_proj\n",
"385:===========================================\n",
"model.layers.25.self_attn.q_norm\n",
"386:===========================================\n",
"model.layers.25.self_attn.k_norm\n",
"387:===========================================\n",
"model.layers.25.mlp\n",
"388:===========================================\n",
"model.layers.25.mlp.gate_proj\n",
"389:===========================================\n",
"model.layers.25.mlp.up_proj\n",
"390:===========================================\n",
"model.layers.25.mlp.down_proj\n",
"391:===========================================\n",
"model.layers.25.mlp.act_fn\n",
"392:===========================================\n",
"model.layers.25.input_layernorm\n",
"393:===========================================\n",
"model.layers.25.post_attention_layernorm\n",
"394:===========================================\n",
"model.layers.26\n",
"395:===========================================\n",
"model.layers.26.self_attn\n",
"396:===========================================\n",
"model.layers.26.self_attn.q_proj\n",
"397:===========================================\n",
"model.layers.26.self_attn.k_proj\n",
"398:===========================================\n",
"model.layers.26.self_attn.v_proj\n",
"399:===========================================\n",
"model.layers.26.self_attn.o_proj\n",
"400:===========================================\n",
"model.layers.26.self_attn.q_norm\n",
"401:===========================================\n",
"model.layers.26.self_attn.k_norm\n",
"402:===========================================\n",
"model.layers.26.mlp\n",
"403:===========================================\n",
"model.layers.26.mlp.gate_proj\n",
"404:===========================================\n",
"model.layers.26.mlp.up_proj\n",
"405:===========================================\n",
"model.layers.26.mlp.down_proj\n",
"406:===========================================\n",
"model.layers.26.mlp.act_fn\n",
"407:===========================================\n",
"model.layers.26.input_layernorm\n",
"408:===========================================\n",
"model.layers.26.post_attention_layernorm\n",
"409:===========================================\n",
"model.layers.27\n",
"410:===========================================\n",
"model.layers.27.self_attn\n",
"411:===========================================\n",
"model.layers.27.self_attn.q_proj\n",
"412:===========================================\n",
"model.layers.27.self_attn.k_proj\n",
"413:===========================================\n",
"model.layers.27.self_attn.v_proj\n",
"414:===========================================\n",
"model.layers.27.self_attn.o_proj\n",
"415:===========================================\n",
"model.layers.27.self_attn.q_norm\n",
"416:===========================================\n",
"model.layers.27.self_attn.k_norm\n",
"417:===========================================\n",
"model.layers.27.mlp\n",
"418:===========================================\n",
"model.layers.27.mlp.gate_proj\n",
"419:===========================================\n",
"model.layers.27.mlp.up_proj\n",
"420:===========================================\n",
"model.layers.27.mlp.down_proj\n",
"421:===========================================\n",
"model.layers.27.mlp.act_fn\n",
"422:===========================================\n",
"model.layers.27.input_layernorm\n",
"423:===========================================\n",
"model.layers.27.post_attention_layernorm\n",
"424:===========================================\n",
"model.layers.28\n",
"425:===========================================\n",
"model.layers.28.self_attn\n",
"426:===========================================\n",
"model.layers.28.self_attn.q_proj\n",
"427:===========================================\n",
"model.layers.28.self_attn.k_proj\n",
"428:===========================================\n",
"model.layers.28.self_attn.v_proj\n",
"429:===========================================\n",
"model.layers.28.self_attn.o_proj\n",
"430:===========================================\n",
"model.layers.28.self_attn.q_norm\n",
"431:===========================================\n",
"model.layers.28.self_attn.k_norm\n",
"432:===========================================\n",
"model.layers.28.mlp\n",
"433:===========================================\n",
"model.layers.28.mlp.gate_proj\n",
"434:===========================================\n",
"model.layers.28.mlp.up_proj\n",
"435:===========================================\n",
"model.layers.28.mlp.down_proj\n",
"436:===========================================\n",
"model.layers.28.mlp.act_fn\n",
"437:===========================================\n",
"model.layers.28.input_layernorm\n",
"438:===========================================\n",
"model.layers.28.post_attention_layernorm\n",
"439:===========================================\n",
"model.layers.29\n",
"440:===========================================\n",
"model.layers.29.self_attn\n",
"441:===========================================\n",
"model.layers.29.self_attn.q_proj\n",
"442:===========================================\n",
"model.layers.29.self_attn.k_proj\n",
"443:===========================================\n",
"model.layers.29.self_attn.v_proj\n",
"444:===========================================\n",
"model.layers.29.self_attn.o_proj\n",
"445:===========================================\n",
"model.layers.29.self_attn.q_norm\n",
"446:===========================================\n",
"model.layers.29.self_attn.k_norm\n",
"447:===========================================\n",
"model.layers.29.mlp\n",
"448:===========================================\n",
"model.layers.29.mlp.gate_proj\n",
"449:===========================================\n",
"model.layers.29.mlp.up_proj\n",
"450:===========================================\n",
"model.layers.29.mlp.down_proj\n",
"451:===========================================\n",
"model.layers.29.mlp.act_fn\n",
"452:===========================================\n",
"model.layers.29.input_layernorm\n",
"453:===========================================\n",
"model.layers.29.post_attention_layernorm\n",
"454:===========================================\n",
"model.layers.30\n",
"455:===========================================\n",
"model.layers.30.self_attn\n",
"456:===========================================\n",
"model.layers.30.self_attn.q_proj\n",
"457:===========================================\n",
"model.layers.30.self_attn.k_proj\n",
"458:===========================================\n",
"model.layers.30.self_attn.v_proj\n",
"459:===========================================\n",
"model.layers.30.self_attn.o_proj\n",
"460:===========================================\n",
"model.layers.30.self_attn.q_norm\n",
"461:===========================================\n",
"model.layers.30.self_attn.k_norm\n",
"462:===========================================\n",
"model.layers.30.mlp\n",
"463:===========================================\n",
"model.layers.30.mlp.gate_proj\n",
"464:===========================================\n",
"model.layers.30.mlp.up_proj\n",
"465:===========================================\n",
"model.layers.30.mlp.down_proj\n",
"466:===========================================\n",
"model.layers.30.mlp.act_fn\n",
"467:===========================================\n",
"model.layers.30.input_layernorm\n",
"468:===========================================\n",
"model.layers.30.post_attention_layernorm\n",
"469:===========================================\n",
"model.layers.31\n",
"470:===========================================\n",
"model.layers.31.self_attn\n",
"471:===========================================\n",
"model.layers.31.self_attn.q_proj\n",
"472:===========================================\n",
"model.layers.31.self_attn.k_proj\n",
"473:===========================================\n",
"model.layers.31.self_attn.v_proj\n",
"474:===========================================\n",
"model.layers.31.self_attn.o_proj\n",
"475:===========================================\n",
"model.layers.31.self_attn.q_norm\n",
"476:===========================================\n",
"model.layers.31.self_attn.k_norm\n",
"477:===========================================\n",
"model.layers.31.mlp\n",
"478:===========================================\n",
"model.layers.31.mlp.gate_proj\n",
"479:===========================================\n",
"model.layers.31.mlp.up_proj\n",
"480:===========================================\n",
"model.layers.31.mlp.down_proj\n",
"481:===========================================\n",
"model.layers.31.mlp.act_fn\n",
"482:===========================================\n",
"model.layers.31.input_layernorm\n",
"483:===========================================\n",
"model.layers.31.post_attention_layernorm\n",
"484:===========================================\n",
"model.layers.32\n",
"485:===========================================\n",
"model.layers.32.self_attn\n",
"486:===========================================\n",
"model.layers.32.self_attn.q_proj\n",
"487:===========================================\n",
"model.layers.32.self_attn.k_proj\n",
"488:===========================================\n",
"model.layers.32.self_attn.v_proj\n",
"489:===========================================\n",
"model.layers.32.self_attn.o_proj\n",
"490:===========================================\n",
"model.layers.32.self_attn.q_norm\n",
"491:===========================================\n",
"model.layers.32.self_attn.k_norm\n",
"492:===========================================\n",
"model.layers.32.mlp\n",
"493:===========================================\n",
"model.layers.32.mlp.gate_proj\n",
"494:===========================================\n",
"model.layers.32.mlp.up_proj\n",
"495:===========================================\n",
"model.layers.32.mlp.down_proj\n",
"496:===========================================\n",
"model.layers.32.mlp.act_fn\n",
"497:===========================================\n",
"model.layers.32.input_layernorm\n",
"498:===========================================\n",
"model.layers.32.post_attention_layernorm\n",
"499:===========================================\n",
"model.layers.33\n",
"500:===========================================\n",
"model.layers.33.self_attn\n",
"501:===========================================\n",
"model.layers.33.self_attn.q_proj\n",
"502:===========================================\n",
"model.layers.33.self_attn.k_proj\n",
"503:===========================================\n",
"model.layers.33.self_attn.v_proj\n",
"504:===========================================\n",
"model.layers.33.self_attn.o_proj\n",
"505:===========================================\n",
"model.layers.33.self_attn.q_norm\n",
"506:===========================================\n",
"model.layers.33.self_attn.k_norm\n",
"507:===========================================\n",
"model.layers.33.mlp\n",
"508:===========================================\n",
"model.layers.33.mlp.gate_proj\n",
"509:===========================================\n",
"model.layers.33.mlp.up_proj\n",
"510:===========================================\n",
"model.layers.33.mlp.down_proj\n",
"511:===========================================\n",
"model.layers.33.mlp.act_fn\n",
"512:===========================================\n",
"model.layers.33.input_layernorm\n",
"513:===========================================\n",
"model.layers.33.post_attention_layernorm\n",
"514:===========================================\n",
"model.layers.34\n",
"515:===========================================\n",
"model.layers.34.self_attn\n",
"516:===========================================\n",
"model.layers.34.self_attn.q_proj\n",
"517:===========================================\n",
"model.layers.34.self_attn.k_proj\n",
"518:===========================================\n",
"model.layers.34.self_attn.v_proj\n",
"519:===========================================\n",
"model.layers.34.self_attn.o_proj\n",
"520:===========================================\n",
"model.layers.34.self_attn.q_norm\n",
"521:===========================================\n",
"model.layers.34.self_attn.k_norm\n",
"522:===========================================\n",
"model.layers.34.mlp\n",
"523:===========================================\n",
"model.layers.34.mlp.gate_proj\n",
"524:===========================================\n",
"model.layers.34.mlp.up_proj\n",
"525:===========================================\n",
"model.layers.34.mlp.down_proj\n",
"526:===========================================\n",
"model.layers.34.mlp.act_fn\n",
"527:===========================================\n",
"model.layers.34.input_layernorm\n",
"528:===========================================\n",
"model.layers.34.post_attention_layernorm\n",
"529:===========================================\n",
"model.layers.35\n",
"530:===========================================\n",
"model.layers.35.self_attn\n",
"531:===========================================\n",
"model.layers.35.self_attn.q_proj\n",
"532:===========================================\n",
"model.layers.35.self_attn.k_proj\n",
"533:===========================================\n",
"model.layers.35.self_attn.v_proj\n",
"534:===========================================\n",
"model.layers.35.self_attn.o_proj\n",
"535:===========================================\n",
"model.layers.35.self_attn.q_norm\n",
"536:===========================================\n",
"model.layers.35.self_attn.k_norm\n",
"537:===========================================\n",
"model.layers.35.mlp\n",
"538:===========================================\n",
"model.layers.35.mlp.gate_proj\n",
"539:===========================================\n",
"model.layers.35.mlp.up_proj\n",
"540:===========================================\n",
"model.layers.35.mlp.down_proj\n",
"541:===========================================\n",
"model.layers.35.mlp.act_fn\n",
"542:===========================================\n",
"model.layers.35.input_layernorm\n",
"543:===========================================\n",
"model.layers.35.post_attention_layernorm\n",
"544:===========================================\n",
"model.norm\n",
"545:===========================================\n",
"model.rotary_emb\n",
"546:===========================================\n",
"lm_head\n"
]
}
],
"source": [
"for i,m in enumerate(model.named_modules()):\n",
" print(str(i) + \":===========================================\")\n",
" print(m[0])"
]
},
{
"cell_type": "code",
"execution_count": null,
"id": "b2250da5-79a6-4a5d-8124-913e3bc3b33a",
"metadata": {},
"outputs": [],
"source": []
}
],
"metadata": {
"kernelspec": {
"display_name": "conda_focallora4",
"language": "python",
"name": "conda_focallora4"
},
"language_info": {
"codemirror_mode": {
"name": "ipython",
"version": 3
},
"file_extension": ".py",
"mimetype": "text/x-python",
"name": "python",
"nbconvert_exporter": "python",
"pygments_lexer": "ipython3",
"version": "3.12.12"
}
},
"nbformat": 4,
"nbformat_minor": 5
}