mudler / mudler/LocalAI

Failed to load MTP Qwen3.6-35B-A3B-UD-Q4_K_S.gguf

Open
#9,893 0 comments 0 reactions 0 assignees View on GitHub

Nobody has claimed this yet.

area/llama.cpp bug unconfirmed upstream issue waiting-from-reporter
Dominant language
Go
Stars
49.2k
Forks
4.5k
Avg merge
1d 3m
Merged PRs (30d)
239

Description

LocalAI version:
LocalAI e859345 (e859345b120341da368b3601a86888203c6ae077)

Environment, CPU architecture, OS, and Version:
RTX 3090, AMD Ryzen

Describe the bug
Failed to load the model

Error: failed to load model with internal loader: could not load model: rpc error: code = Internal desc = Failed to load model: /models/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf. Error: llama_model_load: error loading model: missing tensor 'blk.40.ssm_conv1d.weight'; llama_model_load_from_file_impl: failed to load model; llama_params_fit: encountered an error while trying to fit params to free device memory: failed to load model; llama_model_load: error loading model: missing tensor 'blk.40.ssm_conv1d.weight'; llama_model_load_from_file_impl: failed to load model
Traces für Details anzeigen

To Reproduce
download Qwen3.6-35B-A3B-UD-Q4_K_S.gguf and try to start

Expected behavior
loads successfully

Logs
ggml_cuda_init: found 1 CUDA devices (Total VRAM: 24119 MiB):
10:22:48.381stderr Device 0: NVIDIA GeForce RTX 3090, compute capability 8.6, VMM: yes, VRAM: 24119 MiB
10:22:48.382stderrsystem_info: n_threads = 16 / 32 | CUDA : ARCHS = 750,800,860,890,1200,1210 | USE_GRAPHS = 1 | PEER_MAX_BATCH_SIZE = 128 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 |
10:22:48.382stderr
10:22:48.382stderrsrv load_model: loading model '/models/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf'
10:22:48.382stderrcommon_init_result: fitting params to device memory, for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on
10:22:48.717stderrllama_model_load: error loading model: missing tensor 'blk.40.ssm_conv1d.weight'
10:22:48.717stderrllama_model_load_from_file_impl: failed to load model
10:22:48.748stderrllama_params_fit: encountered an error while trying to fit params to free device memory: failed to load model
10:22:48.748stderrllama_params_fit: fitting params to free memory took 0.37 seconds
10:22:48.748stderrllama_model_load_from_file_impl: using device CUDA0 (NVIDIA GeForce RTX 3090) (0000:0a:00.0) - 23821 MiB free
10:22:48.775stderrllama_model_loader: loaded meta data with 55 key-value pairs and 753 tensors from /models/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf (version GGUF V3 (latest))
10:22:48.775stderrllama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
10:22:48.775stderrllama_model_loader: - kv 0: general.architecture str = qwen35moe
10:22:48.775stderrllama_model_loader: - kv 1: general.type str = model
10:22:48.775stderrllama_model_loader: - kv 2: general.sampling.top_k i32 = 20
10:22:48.775stderrllama_model_loader: - kv 3: general.sampling.top_p f32 = 0.950000
10:22:48.775stderrllama_model_loader: - kv 4: general.sampling.temp f32 = 1.000000
10:22:48.775stderrllama_model_loader: - kv 5: general.name str = Qwen3.6-35B-A3B
10:22:48.775stderrllama_model_loader: - kv 6: general.basename str = Qwen3.6-35B-A3B
10:22:48.775stderrllama_model_loader: - kv 7: general.quantized_by str = Unsloth
10:22:48.775stderrllama_model_loader: - kv 8: general.size_label str = 35B-A3B
10:22:48.775stderrllama_model_loader: - kv 9: general.license str = apache-2.0
10:22:48.775stderrllama_model_loader: - kv 10: general.license.link str = https://huggingface.co/Qwen/Qwen3.6-3...
10:22:48.775stderrllama_model_loader: - kv 11: general.repo_url str = https://huggingface.co/unsloth
10:22:48.775stderrllama_model_loader: - kv 12: general.base_model.count u32 = 1
10:22:48.775stderrllama_model_loader: - kv 13: general.base_model.0.name str = Qwen3.6 35B A3B
10:22:48.775stderrllama_model_loader: - kv 14: general.base_model.0.organization str = Qwen
10:22:48.775stderrllama_model_loader: - kv 15: general.base_model.0.repo_url str = https://huggingface.co/Qwen/Qwen3.6-3...
10:22:48.775stderrllama_model_loader: - kv 16: general.tags arr[str,3] = ["qwen3_5_moe", "qwen", "image-text-t...
10:22:48.775stderrllama_model_loader: - kv 17: qwen35moe.block_count u32 = 41
10:22:48.775stderrllama_model_loader: - kv 18: qwen35moe.context_length u32 = 262144
10:22:48.775stderrllama_model_loader: - kv 19: qwen35moe.embedding_length u32 = 2048
10:22:48.775stderrllama_model_loader: - kv 20: qwen35moe.attention.head_count u32 = 16
10:22:48.775stderrllama_model_loader: - kv 21: qwen35moe.attention.head_count_kv u32 = 2
10:22:48.775stderrllama_model_loader: - kv 22: qwen35moe.rope.dimension_sections arr[i32,4] = [11, 11, 10, 0]
10:22:48.775stderrllama_model_loader: - kv 23: qwen35moe.rope.freq_base f32 = 10000000.000000
10:22:48.775stderrllama_model_loader: - kv 24: qwen35moe.attention.layer_norm_rms_epsilon f32 = 0.000001
10:22:48.775stderrllama_model_loader: - kv 25: qwen35moe.expert_count u32 = 256
10:22:48.775stderrllama_model_loader: - kv 26: qwen35moe.expert_used_count u32 = 8
10:22:48.775stderrllama_model_loader: - kv 27: qwen35moe.attention.key_length u32 = 256
10:22:48.775stderrllama_model_loader: - kv 28: qwen35moe.attention.value_length u32 = 256
10:22:48.775stderrllama_model_loader: - kv 29: qwen35moe.expert_feed_forward_length u32 = 512
10:22:48.775stderrllama_model_loader: - kv 30: qwen35moe.expert_shared_feed_forward_length u32 = 512
10:22:48.775stderrllama_model_loader: - kv 31: qwen35moe.ssm.conv_kernel u32 = 4
10:22:48.775stderrllama_model_loader: - kv 32: qwen35moe.ssm.state_size u32 = 128
10:22:48.775stderrllama_model_loader: - kv 33: qwen35moe.ssm.group_count u32 = 16
10:22:48.775stderrllama_model_loader: - kv 34: qwen35moe.ssm.time_step_rank u32 = 32
10:22:48.775stderrllama_model_loader: - kv 35: qwen35moe.ssm.inner_size u32 = 4096
10:22:48.775stderrllama_model_loader: - kv 36: qwen35moe.full_attention_interval u32 = 4
10:22:48.775stderrllama_model_loader: - kv 37: qwen35moe.rope.dimension_count u32 = 64
10:22:48.775stderrllama_model_loader: - kv 38: qwen35moe.nextn_predict_layers u32 = 1
10:22:48.775stderrllama_model_loader: - kv 39: tokenizer.ggml.model str = gpt2
10:22:48.775stderrllama_model_loader: - kv 40: tokenizer.ggml.pre str = qwen35
10:22:48.792stderrllama_model_loader: - kv 41: tokenizer.ggml.tokens arr[str,248320] = ["!", """, "#", "$", "%", "&", "'", ...
10:22:48.797stderrllama_model_loader: - kv 42: tokenizer.ggml.token_type arr[i32,248320] = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
10:22:48.813stderrllama_model_loader: - kv 43: tokenizer.ggml.merges arr[str,247587] = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
10:22:48.813stderrllama_model_loader: - kv 44: tokenizer.ggml.eos_token_id u32 = 248046
10:22:48.813stderrllama_model_loader: - kv 45: tokenizer.ggml.padding_token_id u32 = 248055
10:22:48.813stderrllama_model_loader: - kv 46: tokenizer.ggml.bos_token_id u32 = 248044
10:22:48.813stderrllama_model_loader: - kv 47: tokenizer.ggml.add_bos_token bool = false
10:22:48.813stderrllama_model_loader: - kv 48: tokenizer.chat_template str = {%- set image_count = namespace(value...
10:22:48.813stderrllama_model_loader: - kv 49: general.quantization_version u32 = 2
10:22:48.813stderrllama_model_loader: - kv 50: general.file_type u32 = 14
10:22:48.813stderrllama_model_loader: - kv 51: quantize.imatrix.file str = Qwen3.6-35B-A3B-GGUF/imatrix_unsloth....
10:22:48.813stderrllama_model_loader: - kv 52: quantize.imatrix.dataset str = unsloth_calibration_Qwen3.6-35B-A3B.txt
10:22:48.813stderrllama_model_loader: - kv 53: quantize.imatrix.entries_count u32 = 510
10:22:48.813stderrllama_model_loader: - kv 54: quantize.imatrix.chunks_count u32 = 77
10:22:48.813stderrllama_model_loader: - type f32: 368 tensors
10:22:48.813stderrllama_model_loader: - type q8_0: 259 tensors
10:22:48.813stderrllama_model_loader: - type q4_K: 120 tensors
10:22:48.813stderrllama_model_loader: - type q6_K: 4 tensors
10:22:48.813stderrllama_model_loader: - type bf16: 2 tensors
10:22:48.813stderrprint_info: file format = GGUF V3 (latest)
10:22:48.813stderrprint_info: file type = Q4_K - Small
10:22:48.813stderrprint_info: file size = 19.91 GiB (4.82 BPW)
10:22:48.891stderrload: 0 unused tokens
10:22:48.910stderrload: printing all EOG tokens:
10:22:48.910stderrload: - 248044 ('<|endoftext|>')
10:22:48.910stderrload: - 248046 ('<|im_end|>')
10:22:48.910stderrload: - 248063 ('<|fim_pad|>')
10:22:48.910stderrload: - 248064 ('<|repo_name|>')
10:22:48.910stderrload: - 248065 ('<|file_sep|>')
10:22:48.910stderrload: special tokens cache size = 33
10:22:48.969stderrload: token to piece cache size = 1.7581 MB
10:22:48.969stderrprint_info: arch = qwen35moe
10:22:48.969stderrprint_info: vocab_only = 0
10:22:48.969stderrprint_info: no_alloc = 0
10:22:48.969stderrprint_info: n_ctx_train = 262144
10:22:48.969stderrprint_info: n_embd = 2048
10:22:48.969stderrprint_info: n_embd_inp = 2048
10:22:48.969stderrprint_info: n_layer = 41
10:22:48.969stderrprint_info: n_head = 16
10:22:48.969stderrprint_info: n_head_kv = 2
10:22:48.969stderrprint_info: n_rot = 64
10:22:48.969stderrprint_info: n_swa = 0
10:22:48.969stderrprint_info: is_swa_any = 0
10:22:48.969stderrprint_info: n_embd_head_k = 256
10:22:48.969stderrprint_info: n_embd_head_v = 256
10:22:48.969stderrprint_info: n_gqa = 8
10:22:48.969stderrprint_info: n_embd_k_gqa = 512
10:22:48.969stderrprint_info: n_embd_v_gqa = 512
10:22:48.969stderrprint_info: f_norm_eps = 0.0e+00
10:22:48.969stderrprint_info: f_norm_rms_eps = 1.0e-06
10:22:48.969stderrprint_info: f_clamp_kqv = 0.0e+00
10:22:48.969stderrprint_info: f_max_alibi_bias = 0.0e+00
10:22:48.969stderrprint_info: f_logit_scale = 0.0e+00
10:22:48.969stderrprint_info: f_attn_scale = 0.0e+00
10:22:48.969stderrprint_info: n_ff = 0
10:22:48.969stderrprint_info: n_expert = 256
10:22:48.969stderrprint_info: n_expert_used = 8
10:22:48.969stderrprint_info: n_expert_groups = 0
10:22:48.969stderrprint_info: n_group_used = 0
10:22:48.969stderrprint_info: causal attn = 1
10:22:48.969stderrprint_info: pooling type = -1
10:22:48.969stderrprint_info: rope type = 40
10:22:48.969stderrprint_info: rope scaling = linear
10:22:48.969stderrprint_info: freq_base_train = 10000000.0
10:22:48.969stderrprint_info: freq_scale_train = 1
10:22:48.969stderrprint_info: n_ctx_orig_yarn = 262144
10:22:48.969stderrprint_info: rope_yarn_log_mul = 0.0000
10:22:48.969stderrprint_info: rope_finetuned = unknown
10:22:48.969stderrprint_info: mrope sections = [11, 11, 10, 0]
10:22:48.969stderrprint_info: ssm_d_conv = 4
10:22:48.969stderrprint_info: ssm_d_inner = 4096
10:22:48.969stderrprint_info: ssm_d_state = 128
10:22:48.969stderrprint_info: ssm_dt_rank = 32
10:22:48.969stderrprint_info: ssm_n_group = 16
10:22:48.969stderrprint_info: ssm_dt_b_c_rms = 0
10:22:48.969stderrprint_info: model type = ?B
10:22:48.969stderrprint_info: model params = 35.51 B
10:22:48.969stderrprint_info: general.name = Qwen3.6-35B-A3B
10:22:48.969stderrprint_info: vocab type = BPE
10:22:48.969stderrprint_info: n_vocab = 248320
10:22:48.969stderrprint_info: n_merges = 247587
10:22:48.969stderrprint_info: BOS token = 248044 '<|endoftext|>'
10:22:48.969stderrprint_info: EOS token = 248046 '<|im_end|>'
10:22:48.969stderrprint_info: EOT token = 248046 '<|im_end|>'
10:22:48.969stderrprint_info: PAD token = 248055 '<|vision_pad|>'
10:22:48.969stderrprint_info: LF token = 198 'Ċ'
10:22:48.969stderrprint_info: FIM PRE token = 248060 '<|fim_prefix|>'
10:22:48.969stderrprint_info: FIM SUF token = 248062 '<|fim_suffix|>'
10:22:48.969stderrprint_info: FIM MID token = 248061 '<|fim_middle|>'
10:22:48.969stderrprint_info: FIM PAD token = 248063 '<|fim_pad|>'
10:22:48.969stderrprint_info: FIM REP token = 248064 '<|repo_name|>'
10:22:48.969stderrprint_info: FIM SEP token = 248065 '<|file_sep|>'
10:22:48.969stderrprint_info: EOG token = 248044 '<|endoftext|>'
10:22:48.969stderrprint_info: EOG token = 248046 '<|im_end|>'
10:22:48.969stderrprint_info: EOG token = 248063 '<|fim_pad|>'
10:22:48.969stderrprint_info: EOG token = 248064 '<|repo_name|>'
10:22:48.969stderrprint_info: EOG token = 248065 '<|file_sep|>'
10:22:48.969stderrprint_info: max token length = 256
10:22:48.969stderrload_tensors: loading model tensors, this can take a while... (mmap = true, direct_io = false)
10:22:48.975stderrllama_model_load: error loading model: missing tensor 'blk.40.ssm_conv1d.weight'
10:22:48.975stderrllama_model_load_from_file_impl: failed to load model
10:22:49.006stderrcommon_init_from_params: failed to load model '/models/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf'
10:22:49.006stderrsrv load_model: failed to load model, '/models/Qwen3.6-35B-A3B-UD-Q4_K_S.gguf'

Contributor guide

Open the contributing guide

First steps

  1. Read the whole issue, then the project's contributing guide.
  2. Comment on the issue to say you are picking it up — it saves two people doing the same work.
  3. Fork the repository and make your change on a branch.
  4. Open a pull request that references the issue number.

Research direction

Start by reproducing the failure described in the issue: download Qwen3.6-35B-A3B-UD-Q4_K_S.gguf and attempt to start it through LocalAI's internal loader. Use the llama_model_load and llama_params_fit errors in the logs to trace the model-loading path. Done means the model loads successfully on the reported RTX 3090 environment.

Written by the indexing model from the issue text.

Assessment

Tech stack
go
Domain
ai, backend
Issue type
Bug
Difficulty
4/5
Estimated time
3-5 days
Activity status
Quiet
Clarity
Needs clarification
Newbie friendliness
35/100

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.