Reset schedule earlier to allow overlap with ggml graph computation on device (ggml-org#6933)

agray3 · nopperl · commit 4f206188df3b · 2024-05-05T21:02:49.000+02:00
* Reset schedule earlier to allow overlap with graph computation on device
diff --git a/ggml-backend.c b/ggml-backend.c
@@ -1784,12 +1784,14 @@ void ggml_backend_sched_free(ggml_backend_sched_t sched) {
 
 void ggml_backend_sched_reset(ggml_backend_sched_t sched) {
     // reset state for the next run
-    size_t hash_size = sched->hash_set.size;
-    memset(sched->hash_set.keys,      0, sizeof(sched->hash_set.keys[0])     * hash_size); // NOLINT
-    memset(sched->tensor_backend_id, -1, sizeof(sched->tensor_backend_id[0]) * hash_size);
-    memset(sched->tensor_copies,      0, sizeof(sched->tensor_copies[0])     * hash_size);
+    if (!sched->is_reset) {
+        size_t hash_size = sched->hash_set.size;
+        memset(sched->hash_set.keys,      0, sizeof(sched->hash_set.keys[0])     * hash_size); // NOLINT
+        memset(sched->tensor_backend_id, -1, sizeof(sched->tensor_backend_id[0]) * hash_size);
+        memset(sched->tensor_copies,      0, sizeof(sched->tensor_copies[0])     * hash_size);
 
-    sched->is_reset = true;
+        sched->is_reset = true;
+    }
     sched->is_alloc = false;
 }
 
diff --git a/llama.cpp b/llama.cpp
@@ -11473,6 +11473,10 @@ static int llama_decode_internal(
         }
     }
 
+    // Reset state for the next token before backend sync, to allow the CPU activities in the reset to
+    // overlap with device computation.
+    ggml_backend_sched_reset(lctx.sched);
+
     return 0;
 }
 

Original file line number	Diff line number	Diff line change
`@@ -11473,6 +11473,10 @@ static int llama_decode_internal(`
`11473`	`11473`	`}`
`11474`	`11474`	`}`
`11475`	`11475`
	`11476`	`+ // Reset state for the next token before backend sync, to allow the CPU activities in the reset to`
	`11477`	`+ // overlap with device computation.`
	`11478`	`+ ggml_backend_sched_reset(lctx.sched);`
	`11479`	`+`
`11476`	`11480`	`return 0;`
`11477`	`11481`	`}`
`11478`	`11482`