metal : reduce command encoding overhead (llama/9698)

ggml-ci
ggerganov · Oct 1, 2024 · b302031 · b302031
1 parent 4de6ee8
commit b302031
Show file tree

Hide file tree

Showing 3 changed files with 1,900 additions and 1,793 deletions.
diff --git a/include/ggml-metal.h b/include/ggml-metal.h
@@ -25,9 +25,6 @@
 #include <stddef.h>
 #include <stdbool.h>
 
-// max memory buffers that can be mapped to the device
-#define GGML_METAL_MAX_BUFFERS 64
-
 struct ggml_tensor;
 struct ggml_cgraph;
 
@@ -48,8 +45,6 @@ GGML_API bool ggml_backend_is_metal(ggml_backend_t backend);
 
 GGML_API GGML_CALL ggml_backend_buffer_t ggml_backend_metal_buffer_from_ptr(void * data, size_t size, size_t max_size);
 
-GGML_API void ggml_backend_metal_set_n_cb(ggml_backend_t backend, int n_cb);
-
 GGML_API void ggml_backend_metal_set_abort_callback(ggml_backend_t backend, ggml_abort_callback abort_callback, void * user_data);
 
 GGML_API GGML_CALL ggml_backend_buffer_type_t ggml_backend_metal_buffer_type(void);

diff --git a/scripts/sync-llama.last b/scripts/sync-llama.last
@@ -1 +1 @@
-c919d5db39c8a7fcb64737f008e4b105ee0acd20
+f1b8c4271125c2bfb9cfebd72a8b9e9f99061a30