Commit f3f1a8f27 for llama.cpp

commit f3f1a8f2760f28325a5ec20c05b171e5b7c83a29
Author: Ruben Ortlam <rortlam@redhat.com>
Date:   Tue Sep 8 18:05:09 2026 +0200

    llama: disable lazy tensor loading by default on iGPUs (#28326)

    * llama: add lazy mode auto, fix iGPU regression

    * revert changes except disabling lazy load on iGPUs in AUTO

diff --git a/src/llama-model.cpp b/src/llama-model.cpp
index ffedf89e6..0adc07449 100644
--- a/src/llama-model.cpp
+++ b/src/llama-model.cpp
@@ -1422,6 +1422,18 @@ bool llama_model_base::load_tensors(llama_model_loader & ml) {
         }
     }

+    // resolve AUTO on systems without mmap support (e.g. iGPUs): fall back to OFF; see #28160
+    if (ml.lazy.mode == LLAMA_LAZY_MODE_AUTO) {
+        for (const auto & dev : devices) {
+            ggml_backend_dev_props props;
+            ggml_backend_dev_get_props(dev.dev, &props);
+            if (!props.caps.mmap_support) {
+                ml.lazy.mode = LLAMA_LAZY_MODE_OFF;
+                break;
+            }
+        }
+    }
+
     const char * load_mode_name = params.load_mode == LLAMA_LOAD_MODE_AUTO
         ? llama_load_mode_name(ml.use_mmap ? LLAMA_LOAD_MODE_MMAP : LLAMA_LOAD_MODE_NONE)
         : llama_load_mode_name(params.load_mode);