Commit 1537a0a8b for llama.cpp

commit 1537a0a8b2f8711d840878b0a0677ab2213c882c
Author: Nik Bogatyrev <50734723+notforu777@users.noreply.github.com>
Date:   Sat Oct 3 18:19:13 2026 +0300

    server : fix laya abort by limiting n_batch to n_ubatch (#29903)

    * server : fix laya abort by limiting n_batch to n_ubatch

    Fixes #29902

    Assisted-by: Claude

    * fix(review) : rm tests, embeddings cond

diff --git a/common/common.cpp b/common/common.cpp
index d3617fbf1..a2f162b6f 100644
--- a/common/common.cpp
+++ b/common/common.cpp
@@ -1285,6 +1285,14 @@ common_init_result::common_init_result(common_params & params, bool model_only)
         LOG_INF("%s", "decision model reads the embeddings output, enabling embedding mode\n");
     }

+    // embeddings need the whole batch in one ubatch, so n_batch must not be larger than n_ubatch
+    // (server.cpp does this check for --embedding, but before the model is loaded)
+    if (cparams.embeddings && cparams.n_batch > cparams.n_ubatch) {
+        LOG_WRN("embeddings enabled: setting n_batch = n_ubatch = %u\n", cparams.n_ubatch);
+        cparams.n_batch = cparams.n_ubatch;
+        params.n_batch  = params.n_ubatch;
+    }
+
     // load and optionally apply lora adapters
     for (auto & la : params.lora_adapters) {
         llama_adapter_lora_ptr lora;