Please answer the following questions for yourself before submitting an issue.
Please provide a detailed written description of what you were trying to do, and what you expected llama.cpp to do.
Hi just started working with llama.cpp and I stumbled on this issue. Maybe its my side but I'm not really getting it working. I want to use the full 32 bit GGUF model converted from a pytorch model if possible without any more quantization. Can you help me or is this a bug? If any more information is required, let me know
Please provide detailed information about your computer setup. This is important in case the issue is not reproducible except for under certain specific conditions.
Please help provide information about the failure / bug.
Its unclear for me what this bug means.
Please provide detailed steps for reproducing the issue. We are not sitting in front of your screen, so the more detail the better.
Please include any relevant log snippets or files. If it works under one configuration but not under another, please provide logs for both configurations and their corresponding outputs so it is easy to see where behavior changes.
[+] Running 1/0
✔ Container llama.cpp-gpu Created 0.0s
Attaching to llama.cpp-gpu
llama.cpp-gpu | Log start
llama.cpp-gpu | main: build = 0 (unknown)
llama.cpp-gpu | main: built with cc (Ubuntu 11.3.0-1ubuntu1~22.04.1) 11.3.0 for x86_64-linux-gnu
llama.cpp-gpu | main: seed = 12345678
llama.cpp-gpu | ggml_init_cublas: found 1 CUDA devices:
llama.cpp-gpu | Device 0: NVIDIA GeForce RTX 4090, compute capability 8.9
llama.cpp-gpu | llama_model_loader: loaded meta data with 20 key-value pairs and 201 tensors from /models/TinyLLama/original/TinyLlama-1.1B-Chat-v0.3/ggml-model-f32.gguf (version unknown)
llama.cpp-gpu | llama_model_loader: - tensor 0: token_embd.weight f32 [ 2048, 32003, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 1: blk.0.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 2: blk.0.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 3: blk.0.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 4: blk.0.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 5: blk.0.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 6: blk.0.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 7: blk.0.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 8: blk.0.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 9: blk.0.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 10: blk.1.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 11: blk.1.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 12: blk.1.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 13: blk.1.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 14: blk.1.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 15: blk.1.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 16: blk.1.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 17: blk.1.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 18: blk.1.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 19: blk.2.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 20: blk.2.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 21: blk.2.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 22: blk.2.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 23: blk.2.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 24: blk.2.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 25: blk.2.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 26: blk.2.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 27: blk.2.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 28: blk.3.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 29: blk.3.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 30: blk.3.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 31: blk.3.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 32: blk.3.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 33: blk.3.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 34: blk.3.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 35: blk.3.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 36: blk.3.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 37: blk.4.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 38: blk.4.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 39: blk.4.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 40: blk.4.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 41: blk.4.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 42: blk.4.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 43: blk.4.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 44: blk.4.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 45: blk.4.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 46: blk.5.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 47: blk.5.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 48: blk.5.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 49: blk.5.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 50: blk.5.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 51: blk.5.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 52: blk.5.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 53: blk.5.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 54: blk.5.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 55: blk.6.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 56: blk.6.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 57: blk.6.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 58: blk.6.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 59: blk.6.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 60: blk.6.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 61: blk.6.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 62: blk.6.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 63: blk.6.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 64: blk.7.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 65: blk.7.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 66: blk.7.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 67: blk.7.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 68: blk.7.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 69: blk.7.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 70: blk.7.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 71: blk.7.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 72: blk.7.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 73: blk.8.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 74: blk.8.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 75: blk.8.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 76: blk.8.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 77: blk.8.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 78: blk.8.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 79: blk.8.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 80: blk.8.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 81: blk.8.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 82: blk.9.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 83: blk.9.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 84: blk.9.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 85: blk.9.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 86: blk.9.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 87: blk.9.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 88: blk.9.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 89: blk.9.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 90: blk.9.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 91: blk.10.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 92: blk.10.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 93: blk.10.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 94: blk.10.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 95: blk.10.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 96: blk.10.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 97: blk.10.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 98: blk.10.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 99: blk.10.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 100: blk.11.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 101: blk.11.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 102: blk.11.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 103: blk.11.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 104: blk.11.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 105: blk.11.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 106: blk.11.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 107: blk.11.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 108: blk.11.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 109: blk.12.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 110: blk.12.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 111: blk.12.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 112: blk.12.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 113: blk.12.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 114: blk.12.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 115: blk.12.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 116: blk.12.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 117: blk.12.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 118: blk.13.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 119: blk.13.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 120: blk.13.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 121: blk.13.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 122: blk.13.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 123: blk.13.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 124: blk.13.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 125: blk.13.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 126: blk.13.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 127: blk.14.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 128: blk.14.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 129: blk.14.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 130: blk.14.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 131: blk.14.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 132: blk.14.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 133: blk.14.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 134: blk.14.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 135: blk.14.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 136: blk.15.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 137: blk.15.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 138: blk.15.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 139: blk.15.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 140: blk.15.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 141: blk.15.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 142: blk.15.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 143: blk.15.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 144: blk.15.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 145: blk.16.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 146: blk.16.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 147: blk.16.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 148: blk.16.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 149: blk.16.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 150: blk.16.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 151: blk.16.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 152: blk.16.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 153: blk.16.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 154: blk.17.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 155: blk.17.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 156: blk.17.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 157: blk.17.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 158: blk.17.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 159: blk.17.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 160: blk.17.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 161: blk.17.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 162: blk.17.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 163: blk.18.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 164: blk.18.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 165: blk.18.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 166: blk.18.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 167: blk.18.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 168: blk.18.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 169: blk.18.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 170: blk.18.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 171: blk.18.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 172: blk.19.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 173: blk.19.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 174: blk.19.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 175: blk.19.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 176: blk.19.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 177: blk.19.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 178: blk.19.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 179: blk.19.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 180: blk.19.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 181: blk.20.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 182: blk.20.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 183: blk.20.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 184: blk.20.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 185: blk.20.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 186: blk.20.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 187: blk.20.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 188: blk.20.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 189: blk.20.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 190: blk.21.attn_q.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 191: blk.21.attn_k.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 192: blk.21.attn_v.weight f32 [ 2048, 256, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 193: blk.21.attn_output.weight f32 [ 2048, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 194: blk.21.ffn_gate.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 195: blk.21.ffn_up.weight f32 [ 2048, 5632, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 196: blk.21.ffn_down.weight f32 [ 5632, 2048, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 197: blk.21.attn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 198: blk.21.ffn_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 199: output_norm.weight f32 [ 2048, 1, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - tensor 200: output.weight f32 [ 2048, 32003, 1, 1 ]
llama.cpp-gpu | llama_model_loader: - kv 0: general.architecture str
llama.cpp-gpu | llama_model_loader: - kv 1: general.name str
llama.cpp-gpu | llama_model_loader: - kv 2: llama.context_length u32
llama.cpp-gpu | llama_model_loader: - kv 3: llama.embedding_length u32
llama.cpp-gpu | llama_model_loader: - kv 4: llama.block_count u32
llama.cpp-gpu | llama_model_loader: - kv 5: llama.feed_forward_length u32
llama.cpp-gpu | llama_model_loader: - kv 6: llama.rope.dimension_count u32
llama.cpp-gpu | llama_model_loader: - kv 7: llama.attention.head_count u32
llama.cpp-gpu | llama_model_loader: - kv 8: llama.attention.head_count_kv u32
llama.cpp-gpu | llama_model_loader: - kv 9: llama.attention.layer_norm_rms_epsilon f32
llama.cpp-gpu | llama_model_loader: - kv 10: llama.rope.freq_base f32
llama.cpp-gpu | llama_model_loader: - kv 11: general.file_type u32
llama.cpp-gpu | llama_model_loader: - kv 12: tokenizer.ggml.model str
llama.cpp-gpu | llama_model_loader: - kv 13: tokenizer.ggml.tokens arr
llama.cpp-gpu | llama_model_loader: - kv 14: tokenizer.ggml.scores arr
llama.cpp-gpu | llama_model_loader: - kv 15: tokenizer.ggml.token_type arr
llama.cpp-gpu | llama_model_loader: - kv 16: tokenizer.ggml.bos_token_id u32
llama.cpp-gpu | llama_model_loader: - kv 17: tokenizer.ggml.eos_token_id u32
llama.cpp-gpu | llama_model_loader: - kv 18: tokenizer.ggml.unknown_token_id u32
llama.cpp-gpu | llama_model_loader: - kv 19: tokenizer.ggml.padding_token_id u32
llama.cpp-gpu | llama_model_loader: - type f32: 201 tensors
llama.cpp-gpu | llm_load_print_meta: format = unknown
llama.cpp-gpu | llm_load_print_meta: arch = llama
llama.cpp-gpu | llm_load_print_meta: vocab type = SPM
llama.cpp-gpu | llm_load_print_meta: n_vocab = 32003
llama.cpp-gpu | llm_load_print_meta: n_merges = 0
llama.cpp-gpu | llm_load_print_meta: n_ctx_train = 2048
llama.cpp-gpu | llm_load_print_meta: n_embd = 2048
llama.cpp-gpu | llm_load_print_meta: n_head = 32
llama.cpp-gpu | llm_load_print_meta: n_head_kv = 4
llama.cpp-gpu | llm_load_print_meta: n_layer = 22
llama.cpp-gpu | llm_load_print_meta: n_rot = 64
llama.cpp-gpu | llm_load_print_meta: n_gqa = 8
llama.cpp-gpu | llm_load_print_meta: f_norm_eps = 0.0e+00
llama.cpp-gpu | llm_load_print_meta: f_norm_rms_eps = 1.0e-05
llama.cpp-gpu | llm_load_print_meta: f_clamp_kqv = 0.0e+00
llama.cpp-gpu | llm_load_print_meta: f_max_alibi_bias = 0.0e+00
llama.cpp-gpu | llm_load_print_meta: n_ff = 5632
llama.cpp-gpu | llm_load_print_meta: freq_base_train = 10000.0
llama.cpp-gpu | llm_load_print_meta: freq_scale_train = 1
llama.cpp-gpu | llm_load_print_meta: model type = ?B
llama.cpp-gpu | llm_load_print_meta: model ftype = all F32
llama.cpp-gpu | llm_load_print_meta: model params = 1.10 B
llama.cpp-gpu | llm_load_print_meta: model size = 4.10 GiB (32.00 BPW)
llama.cpp-gpu | llm_load_print_meta: general.name = models
llama.cpp-gpu | llm_load_print_meta: BOS token = 1 '<s>'
llama.cpp-gpu | llm_load_print_meta: EOS token = 2 '</s>'
llama.cpp-gpu | llm_load_print_meta: UNK token = 0 '<unk>'
llama.cpp-gpu | llm_load_print_meta: PAD token = 32000 '[PAD]'
llama.cpp-gpu | llm_load_print_meta: LF token = 13 '<0x0A>'
llama.cpp-gpu | llm_load_tensors: ggml ctx size = 0.07 MB
llama.cpp-gpu | llm_load_tensors: using CUDA for GPU acceleration
llama.cpp-gpu | llm_load_tensors: mem required = 250.09 MB
llama.cpp-gpu | llm_load_tensors: offloading 22 repeating layers to GPU
llama.cpp-gpu | llm_load_tensors: offloading non-repeating layers to GPU
llama.cpp-gpu | llm_load_tensors: offloaded 25/25 layers to GPU
llama.cpp-gpu | llm_load_tensors: VRAM used: 3946.38 MB
llama.cpp-gpu | .GGML_ASSERT: ggml-cuda.cu:6115: false
llama.cpp-gpu exited with code 139
Prerequisites
Please answer the following questions for yourself before submitting an issue.
Expected Behavior
Please provide a detailed written description of what you were trying to do, and what you expected
llama.cppto do.Hi just started working with llama.cpp and I stumbled on this issue. Maybe its my side but I'm not really getting it working. I want to use the full 32 bit GGUF model converted from a pytorch model if possible without any more quantization. Can you help me or is this a bug? If any more information is required, let me know
python3 convert.py ./models/tinyllama-1.1b-chat-v0.3Current Behavior
Please provide a detailed written description of what
llama.cppdid, instead.python3 convert.py ./models/tinyllama-1.1b-chat-v0.3(succeeds)while other bit level does work:
python3 convert.py ./models/tinyllama-1.1b-chat-v0.3 --outtype f16(succeeds)Environment and Context
Please provide detailed information about your computer setup. This is important in case the issue is not reproducible except for under certain specific conditions.
$ lscpu$ uname -aFailure Information (for bugs)
Please help provide information about the failure / bug.
Its unclear for me what this bug means.
Steps to Reproduce
Please provide detailed steps for reproducing the issue. We are not sitting in front of your screen, so the more detail the better.
python3 convert.py ./models/tinyllama-1.1b-chat-v0.3Failure Logs
Please include any relevant log snippets or files. If it works under one configuration but not under another, please provide logs for both configurations and their corresponding outputs so it is easy to see where behavior changes.
Log of 32 bit container