Commit f3f1a8f27 for llama.cpp
commit f3f1a8f2760f28325a5ec20c05b171e5b7c83a29
Author: Ruben Ortlam <rortlam@redhat.com>
Date: Tue Sep 8 18:05:09 2026 +0200
llama: disable lazy tensor loading by default on iGPUs (#28326)
* llama: add lazy mode auto, fix iGPU regression
* revert changes except disabling lazy load on iGPUs in AUTO
diff --git a/src/llama-model.cpp b/src/llama-model.cpp
index ffedf89e6..0adc07449 100644
--- a/src/llama-model.cpp
+++ b/src/llama-model.cpp
@@ -1422,6 +1422,18 @@ bool llama_model_base::load_tensors(llama_model_loader & ml) {
}
}
+ // resolve AUTO on systems without mmap support (e.g. iGPUs): fall back to OFF; see #28160
+ if (ml.lazy.mode == LLAMA_LAZY_MODE_AUTO) {
+ for (const auto & dev : devices) {
+ ggml_backend_dev_props props;
+ ggml_backend_dev_get_props(dev.dev, &props);
+ if (!props.caps.mmap_support) {
+ ml.lazy.mode = LLAMA_LAZY_MODE_OFF;
+ break;
+ }
+ }
+ }
+
const char * load_mode_name = params.load_mode == LLAMA_LOAD_MODE_AUTO
? llama_load_mode_name(ml.use_mmap ? LLAMA_LOAD_MODE_MMAP : LLAMA_LOAD_MODE_NONE)
: llama_load_mode_name(params.load_mode);