Skip to content

Misc. bug: [SYCL] Missing kernels for Qwen3-VL vision encoder (UPSCALE, mRoPE, etc.) on Intel Arc A770 #19543

Description

@Hisir0909

Name and Version

❯ ./llama-server --version
version: 8007 (4ae1b75)
built with IntelLLVM 2025.3.0 for Linux x86_64

Operating systems

Linux

Which llama.cpp modules do you know to be affected?

llama-server

Command line

./llama-server -m ~/Downloads/models/gguf/qwen-3-vl-8b/Qwen3-VL-8B-Instruct-Q6_K.gguf --mmproj ~/Downloads/models/gguf/qwen-3-vl-8b/mmproj-BF16.gguf -ngl 999 -c 4096 -n 512 -fa on --host 0.0.0.0 --no-warmup --image-max-tokens 2048 -np 1

Problem description & steps to reproduce

When running Qwen3-VL, the vision encoder fails to use SYCL acceleration for several key operators, leading to CPU fallback and slow performance (~23s for image encoding). The logs explicitly list unsupported ops: UPSCALE, SOFT_MAX, ROPE, MUL_MAT, etc.

First Bad Commit

No response

Relevant log output

Logs
❯ ./llama-server -m ~/Downloads/models/gguf/qwen-3-vl-8b/Qwen3-VL-8B-Instruct-Q6_K.gguf --mmproj ~/Downloads/models/gguf/qwen-3-vl-8b/mmproj-BF16.gguf -ngl 999 -c 4096 -n 512 -fa on --host 0.0.0.0 --no-warmup --image-max-tokens 2048 -np 1
build: 8007 (4ae1b7517) with IntelLLVM 2025.3.0 for Linux x86_64
system info: n_threads = 6, n_threads_batch = 6, total_threads = 12

system_info: n_threads = 6 (n_threads_batch = 6) / 12 | CPU : SSE3 = 1 | SSSE3 = 1 | AVX = 1 | AVX2 = 1 | F16C = 1 | FMA = 1 | BMI2 = 1 | AVX512 = 1 | AVX512_VBMI = 1 | AVX512_VNNI = 1 | AVX512_BF16 = 1 | LLAMAFILE = 1 | OPENMP = 1 | REPACK = 1 | 

init: using 11 threads for HTTP server
start: binding port with default address family
main: loading model
srv    load_model: loading model '/home/u/Downloads/models/gguf/qwen-3-vl-8b/Qwen3-VL-8B-Instruct-Q6_K.gguf'
common_init_result: fitting params to device memory, for bugs during this step try to reproduce them with -fit off, or provide --verbose logs if the bug only occurs with -fit on
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
llama_params_fit_impl: projected to use 6810 MiB of device memory vs. 15473 MiB of free device memory
llama_params_fit_impl: will leave 8663 >= 1024 MiB of free device memory, no changes needed
llama_params_fit: successfully fit params to free device memory
llama_params_fit: fitting params to free memory took 0.16 seconds
llama_model_load_from_file_impl: using device SYCL0 (Intel(R) Arc(TM) A770 Graphics) (unknown id) - 15473 MiB free
llama_model_loader: loaded meta data with 42 key-value pairs and 399 tensors from /home/u/Downloads/models/gguf/qwen-3-vl-8b/Qwen3-VL-8B-Instruct-Q6_K.gguf (version GGUF V3 (latest))
llama_model_loader: Dumping metadata keys/values. Note: KV overrides do not apply in this output.
llama_model_loader: - kv   0:                       general.architecture str              = qwen3vl
llama_model_loader: - kv   1:                               general.type str              = model
llama_model_loader: - kv   2:                               general.name str              = Qwen3-Vl-8B-Instruct
llama_model_loader: - kv   3:                           general.finetune str              = Instruct
llama_model_loader: - kv   4:                           general.basename str              = Qwen3-Vl-8B-Instruct
llama_model_loader: - kv   5:                       general.quantized_by str              = Unsloth
llama_model_loader: - kv   6:                         general.size_label str              = 8B
llama_model_loader: - kv   7:                            general.license str              = apache-2.0
llama_model_loader: - kv   8:                           general.repo_url str              = https://huggingface.co/unsloth
llama_model_loader: - kv   9:                   general.base_model.count u32              = 1
llama_model_loader: - kv  10:                  general.base_model.0.name str              = Qwen3 VL 8B Instruct
llama_model_loader: - kv  11:          general.base_model.0.organization str              = Qwen
llama_model_loader: - kv  12:              general.base_model.0.repo_url str              = https://huggingface.co/Qwen/Qwen3-VL-...
llama_model_loader: - kv  13:                               general.tags arr[str,2]       = ["unsloth", "image-text-to-text"]
llama_model_loader: - kv  14:                        qwen3vl.block_count u32              = 36
llama_model_loader: - kv  15:                     qwen3vl.context_length u32              = 262144
llama_model_loader: - kv  16:                   qwen3vl.embedding_length u32              = 4096
llama_model_loader: - kv  17:                qwen3vl.feed_forward_length u32              = 12288
llama_model_loader: - kv  18:               qwen3vl.attention.head_count u32              = 32
llama_model_loader: - kv  19:            qwen3vl.attention.head_count_kv u32              = 8
llama_model_loader: - kv  20:                     qwen3vl.rope.freq_base f32              = 5000000.000000
llama_model_loader: - kv  21:   qwen3vl.attention.layer_norm_rms_epsilon f32              = 0.000001
llama_model_loader: - kv  22:               qwen3vl.attention.key_length u32              = 128
llama_model_loader: - kv  23:             qwen3vl.attention.value_length u32              = 128
llama_model_loader: - kv  24:            qwen3vl.rope.dimension_sections arr[i32,4]       = [24, 20, 20, 0]
llama_model_loader: - kv  25:                 qwen3vl.n_deepstack_layers u32              = 3
llama_model_loader: - kv  26:                       tokenizer.ggml.model str              = gpt2
llama_model_loader: - kv  27:                         tokenizer.ggml.pre str              = qwen2
llama_model_loader: - kv  28:                      tokenizer.ggml.tokens arr[str,151936]  = ["!", "\"", "#", "$", "%", "&", "'", ...
llama_model_loader: - kv  29:                  tokenizer.ggml.token_type arr[i32,151936]  = [1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, ...
llama_model_loader: - kv  30:                      tokenizer.ggml.merges arr[str,151387]  = ["Ġ Ġ", "ĠĠ ĠĠ", "i n", "Ġ t",...
llama_model_loader: - kv  31:                tokenizer.ggml.eos_token_id u32              = 151645
llama_model_loader: - kv  32:            tokenizer.ggml.padding_token_id u32              = 151654
llama_model_loader: - kv  33:                tokenizer.ggml.bos_token_id u32              = 151643
llama_model_loader: - kv  34:               tokenizer.ggml.add_bos_token bool             = false
llama_model_loader: - kv  35:                    tokenizer.chat_template str              = {%- if tools %}\n    {{- '<|im_start|>...
llama_model_loader: - kv  36:               general.quantization_version u32              = 2
llama_model_loader: - kv  37:                          general.file_type u32              = 18
llama_model_loader: - kv  38:                      quantize.imatrix.file str              = Qwen3-VL-8B-Instruct-GGUF/imatrix_uns...
llama_model_loader: - kv  39:                   quantize.imatrix.dataset str              = unsloth_calibration_Qwen3-VL-8B-Instr...
llama_model_loader: - kv  40:             quantize.imatrix.entries_count u32              = 252
llama_model_loader: - kv  41:              quantize.imatrix.chunks_count u32              = 694
llama_model_loader: - type  f32:  145 tensors
llama_model_loader: - type q6_K:  254 tensors
print_info: file format = GGUF V3 (latest)
print_info: file type   = Q6_K
print_info: file size   = 6.26 GiB (6.56 BPW) 
load: 0 unused tokens
load: printing all EOG tokens:
load:   - 151643 ('<|endoftext|>')
load:   - 151645 ('<|im_end|>')
load:   - 151662 ('<|fim_pad|>')
load:   - 151663 ('<|repo_name|>')
load:   - 151664 ('<|file_sep|>')
load: special tokens cache size = 26
load: token to piece cache size = 0.9311 MB
print_info: arch                  = qwen3vl
print_info: vocab_only            = 0
print_info: no_alloc              = 0
print_info: n_ctx_train           = 262144
print_info: n_embd                = 4096
print_info: n_embd_inp            = 16384
print_info: n_layer               = 36
print_info: n_head                = 32
print_info: n_head_kv             = 8
print_info: n_rot                 = 128
print_info: n_swa                 = 0
print_info: is_swa_any            = 0
print_info: n_embd_head_k         = 128
print_info: n_embd_head_v         = 128
print_info: n_gqa                 = 4
print_info: n_embd_k_gqa          = 1024
print_info: n_embd_v_gqa          = 1024
print_info: f_norm_eps            = 0.0e+00
print_info: f_norm_rms_eps        = 1.0e-06
print_info: f_clamp_kqv           = 0.0e+00
print_info: f_max_alibi_bias      = 0.0e+00
print_info: f_logit_scale         = 0.0e+00
print_info: f_attn_scale          = 0.0e+00
print_info: n_ff                  = 12288
print_info: n_expert              = 0
print_info: n_expert_used         = 0
print_info: n_expert_groups       = 0
print_info: n_group_used          = 0
print_info: causal attn           = 1
print_info: pooling type          = 0
print_info: rope type             = 40
print_info: rope scaling          = linear
print_info: freq_base_train       = 5000000.0
print_info: freq_scale_train      = 1
print_info: n_ctx_orig_yarn       = 262144
print_info: rope_yarn_log_mul     = 0.0000
print_info: rope_finetuned        = unknown
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
print_info: mrope sections        = [24, 20, 20, 0]
print_info: model type            = 8B
print_info: model params          = 8.19 B
print_info: general.name          = Qwen3-Vl-8B-Instruct
print_info: vocab type            = BPE
print_info: n_vocab               = 151936
print_info: n_merges              = 151387
print_info: BOS token             = 151643 '<|endoftext|>'
print_info: EOS token             = 151645 '<|im_end|>'
print_info: EOT token             = 151645 '<|im_end|>'
print_info: PAD token             = 151654 '<|vision_pad|>'
print_info: LF token              = 198 'Ċ'
print_info: FIM PRE token         = 151659 '<|fim_prefix|>'
print_info: FIM SUF token         = 151661 '<|fim_suffix|>'
print_info: FIM MID token         = 151660 '<|fim_middle|>'
print_info: FIM PAD token         = 151662 '<|fim_pad|>'
print_info: FIM REP token         = 151663 '<|repo_name|>'
print_info: FIM SEP token         = 151664 '<|file_sep|>'
print_info: EOG token             = 151643 '<|endoftext|>'
print_info: EOG token             = 151645 '<|im_end|>'
print_info: EOG token             = 151662 '<|fim_pad|>'
print_info: EOG token             = 151663 '<|repo_name|>'
print_info: EOG token             = 151664 '<|file_sep|>'
print_info: max token length      = 256
load_tensors: loading model tensors, this can take a while... (mmap = true, direct_io = false)
get_memory_info: [warning] ext_intel_free_memory is not supported (export/set ZES_ENABLE_SYSMAN=1 to support), use total memory as free memory
load_tensors: offloading output layer to GPU
load_tensors: offloading 35 repeating layers to GPU
load_tensors: offloaded 37/37 layers to GPU
load_tensors:   CPU_Mapped model buffer size =   486.86 MiB
load_tensors:        SYCL0 model buffer size =  5921.78 MiB
.......................................................................................
common_init_result: added <|endoftext|> logit bias = -inf
common_init_result: added <|im_end|> logit bias = -inf
common_init_result: added <|fim_pad|> logit bias = -inf
common_init_result: added <|repo_name|> logit bias = -inf
common_init_result: added <|file_sep|> logit bias = -inf
llama_context: constructing llama_context
llama_context: n_seq_max     = 1
llama_context: n_ctx         = 4096
llama_context: n_ctx_seq     = 4096
llama_context: n_batch       = 2048
llama_context: n_ubatch      = 512
llama_context: causal_attn   = 1
llama_context: flash_attn    = enabled
llama_context: kv_unified    = false
llama_context: freq_base     = 5000000.0
llama_context: freq_scale    = 1
llama_context: n_ctx_seq (4096) < n_ctx_train (262144) -- the full capacity of the model will not be utilized
llama_context:  SYCL_Host  output buffer size =     0.58 MiB
llama_kv_cache:      SYCL0 KV buffer size =   576.00 MiB
llama_kv_cache: size =  576.00 MiB (  4096 cells,  36 layers,  1/1 seqs), K (f16):  288.00 MiB, V (f16):  288.00 MiB
sched_reserve: reserving ...
sched_reserve:      SYCL0 compute buffer size =   312.75 MiB
sched_reserve:  SYCL_Host compute buffer size =    68.02 MiB
sched_reserve: graph nodes  = 1275
sched_reserve: graph splits = 74
sched_reserve: reserve took 3.62 ms, sched copies = 1
clip_model_loader: model name:   Qwen3-Vl-8B-Instruct
clip_model_loader: description:  
clip_model_loader: GGUF version: 3
clip_model_loader: alignment:    32
clip_model_loader: n_tensors:    352
clip_model_loader: n_kv:         31

clip_model_loader: has vision encoder
clip_ctx: CLIP using SYCL0 backend
load_hparams: Qwen-VL models require at minimum 1024 image tokens to function correctly on grounding tasks
load_hparams: if you encounter problems with accuracy, try adding --image-min-tokens 1024
load_hparams: more info: https://github.com/ggml-org/llama.cpp/issues/16842

load_hparams: projector:          qwen3vl_merger
load_hparams: n_embd:             1152
load_hparams: n_head:             16
load_hparams: n_ff:               4304
load_hparams: n_layer:            27
load_hparams: ffn_op:             gelu
load_hparams: projection_dim:     4096

--- vision hparams ---
load_hparams: image_size:         768
load_hparams: patch_size:         16
load_hparams: has_llava_proj:     0
load_hparams: minicpmv_version:   0
load_hparams: n_merge:            2
load_hparams: n_wa_pattern: 0
load_hparams: image_min_pixels:   8192
load_hparams: image_max_pixels:   2097152 (custom value)

load_hparams: model size:         1108.69 MiB
load_hparams: metadata size:      0.12 MiB
srv    load_model: loaded multimodal model, '/home/u/Downloads/models/gguf/qwen-3-vl-8b/mmproj-BF16.gguf'
srv    load_model: initializing slots, n_slots = 1
no implementations specified for speculative decoding
slot   load_model: id  0 | task -1 | speculative decoding context not initialized
slot   load_model: id  0 | task -1 | new slot, n_ctx = 4096
srv    load_model: prompt cache is enabled, size limit: 8192 MiB
srv    load_model: use `--cache-ram 0` to disable the prompt cache
srv    load_model: for more info see https://github.com/ggml-org/llama.cpp/pull/16391
init: chat template, example_format: '<|im_start|>system
You are a helpful assistant<|im_end|>
<|im_start|>user
Hello<|im_end|>
<|im_start|>assistant
Hi there<|im_end|>
<|im_start|>user
How are you?<|im_end|>
<|im_start|>assistant
'
srv          init: init: chat template, thinking = 0
main: model loaded
main: server is listening on http://0.0.0.0:8080
main: starting the main loop...
srv  update_slots: all slots are idle
srv  params_from_: Chat format: Hermes 2 Pro
slot get_availabl: id  0 | task -1 | selected slot by LRU, t_last = -1
slot launch_slot_: id  0 | task -1 | sampler chain: logits -> ?penalties -> ?dry -> ?top-n-sigma -> top-k -> ?typical -> top-p -> min-p -> ?xtc -> temp-ext -> dist 
slot launch_slot_: id  0 | task 0 | processing task, is_child = 0
slot update_slots: id  0 | task 0 | new prompt, n_ctx_slot = 4096, n_keep = 0, task.n_tokens = 2009
slot update_slots: id  0 | task 0 | n_tokens = 0, memory_seq_rm [0, end)
slot update_slots: id  0 | task 0 | prompt processing progress, n_tokens = 8, batch.n_tokens = 8, progress = 0.003982
slot update_slots: id  0 | task 0 | n_tokens = 8, memory_seq_rm [8, end)
srv  process_chun: processing image...
encoding image slice...
alloc_compute_meta:      SYCL0 compute buffer size =   333.27 MiB
alloc_compute_meta:        CPU compute buffer size =   175.54 MiB
alloc_compute_meta: graph splits = 262, nodes = 853
warmup: *****************************************************************
warmup: WARNING: flash attention not supported by SYCL0, memory usage will increase
warmup: op params: 
warmup:    dst: type = f32, ne = [72 16 7980 1], nb = [4 288 4608 36771840]
warmup:   src0: type = f32, ne = [72 7980 16 1], nb = [4 4608 288 36771840]
warmup:   src1: type = f16, ne = [72 7980 16 1], nb = [2 144 1149120 18385920]
warmup:   src2: type = f16, ne = [72 7980 16 1], nb = [2 144 1149120 18385920]
warmup: please report this on github as an issue
warmup: *****************************************************************
alloc_compute_meta:      SYCL0 compute buffer size =  4272.50 MiB
alloc_compute_meta:        CPU compute buffer size =   175.54 MiB
alloc_compute_meta: graph splits = 235, nodes = 907
warmup: flash attention is disabled
warmup: *****************************************************************
warmup: WARNING: the CLIP graph uses unsupported operators by the backend
warmup:          the performance will be suboptimal                      
warmup:          list of unsupported ops (backend=SYCL0):
warmup:          UPSCALE: type = f32, ne = [114 70 1152 1]
warmup:          MUL_MAT: type = f32, ne = [3456 7980 1 1]
warmup:         SOFT_MAX: type = f32, ne = [7980 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [4304 7980 1 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:             CONT: type = f32, ne = [7980 72 16 1]
warmup:         SOFT_MAX: type = f32, ne = [7980 7980 16 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:             CONT: type = f32, ne = [7980 72 16 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [4304 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:         SOFT_MAX: type = f32, ne = [7980 7980 16 1]
warmup:             CONT: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             CONT: type = f32, ne = [7980 72 16 1]
warmup:          MUL_MAT: type = f32, ne = [72 7980 16 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [3456 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [7980 7980 16 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [3456 7980 1 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [7980 72 16 1]
warmup:             CONT: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [4304 7980 1 1]
warmup:            UNARY: type = f32, ne = [4608 1995 1 1]
warmup:              ADD: type = f32, ne = [4096 1995 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          MUL_MAT: type = f32, ne = [7980 7980 16 1]
warmup:              ADD: type = f32, ne = [4304 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [3456 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [7980 72 16 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [4304 7980 1 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [3456 7980 1 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             CONT: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [4304 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [3456 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [72 7980 16 1]
warmup:             CONT: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:            UNARY: type = f32, ne = [4304 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [7980 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [72 7980 16 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [4304 7980 1 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              MUL: type = f32, ne = [4608 1995 1 1]
warmup:              ADD: type = f32, ne = [4096 1995 1 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [7980 72 16 1]
warmup:             CONT: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:            UNARY: type = f32, ne = [4304 7980 1 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [72 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [4304 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          MUL_MAT: type = f32, ne = [7980 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [3456 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [7980 72 16 1]
warmup:         SOFT_MAX: type = f32, ne = [7980 7980 16 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [3456 7980 1 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:             CONT: type = f32, ne = [7980 72 16 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [72 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             NORM: type = f32, ne = [1152 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          MUL_MAT: type = f32, ne = [4304 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:             ROPE: type = f32, ne = [72 16 7980 1]
warmup:          MUL_MAT: type = f32, ne = [7980 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [4608 1995 1 1]
warmup:            UNARY: type = f32, ne = [4608 1995 1 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:             VIEW: type = f32, ne = [72 16 7980 1]
warmup:          PERMUTE: type = f32, ne = [7980 72 16 1]
warmup:         SOFT_MAX: type = f32, ne = [7980 7980 16 1]
warmup:          PERMUTE: type = f32, ne = [72 16 7980 1]
warmup:              ADD: type = f32, ne = [1152 7980 1 1]
warmup:              MUL: type = f32, ne = [1152 7980 1 1]
warmup:              ADD: type = f32, ne = [3456 7980 1 1]
warmup:          MUL_MAT: type = f32, ne = [72 7980 16 1]
warmup:          MUL_MAT: type = f32, ne = [1152 7980 1 1]
warmup: flash attention is disabled
warmup: please report this on github as an issue
warmup: ref: https://github.com/ggml-org/llama.cpp/pull/16837#issuecomment-3461676118
warmup: *****************************************************************
image slice encoded in 11647 ms
decoding image batch 1/1, n_tokens_batch = 1995
image decoded (batch 1/1) in 11241 ms
srv  process_chun: image processed in 22888 ms
slot update_slots: id  0 | task 0 | prompt processing progress, n_tokens = 2009, batch.n_tokens = 6, progress = 1.000000
slot update_slots: id  0 | task 0 | prompt done, n_tokens = 2009, batch.n_tokens = 6
slot init_sampler: id  0 | task 0 | init sampler, took 0.01 ms, tokens: text = 14, total = 2009
slot print_timing: id  0 | task 0 | 
prompt eval time =   23797.18 ms /  2009 tokens (   11.85 ms per token,    84.42 tokens per second)
       eval time =   45940.98 ms /   461 tokens (   99.66 ms per token,    10.03 tokens per second)
      total time =   69738.16 ms /  2470 tokens
slot      release: id  0 | task 0 | stop processing: n_tokens = 2469, truncated = 0
srv  update_slots: all slots are idle
srv  log_server_r: done request: POST /v1/chat/completions 10.0.0.102 200

Reference

This relates to PR #16837 (SYCL support for Qwen-VL). The log includes a direct reference to it.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Type

No type

Projects

No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions