vulkan: implement FLOOR

giuseppe · giuseppe · commit ea3cb4e38e9f · 2025-11-18T10:17:42.000+01:00
Signed-off-by: Giuseppe Scrivano &lt;gscrivan@redhat.com&gt;
diff --git a/ggml/src/ggml-vulkan/ggml-vulkan.cpp b/ggml/src/ggml-vulkan/ggml-vulkan.cpp
@@ -668,6 +668,7 @@ struct vk_device_struct {
     vk_pipeline pipeline_step[2];
     vk_pipeline pipeline_round[2];
     vk_pipeline pipeline_ceil[2];
+    vk_pipeline pipeline_floor[2];
 
     vk_pipeline pipeline_add1_f16_f16;
     vk_pipeline pipeline_add1_f16_f32;
@@ -3842,6 +3843,7 @@ static void ggml_vk_load_shaders(vk_device& device) {
     CREATE_UNARY(step)
     CREATE_UNARY(round)
     CREATE_UNARY(ceil)
+    CREATE_UNARY(floor)
 #undef CREATE_UNARY
 
 #define CREATE_UNARY_RTE(name)  \
@@ -8274,6 +8276,8 @@ static vk_pipeline ggml_vk_op_get_pipeline(ggml_backend_vk_context * ctx, const
                 return ctx->device->pipeline_round[dst->type == GGML_TYPE_F16];
             case GGML_UNARY_OP_CEIL:
                 return ctx->device->pipeline_ceil[dst->type == GGML_TYPE_F16];
+            case GGML_UNARY_OP_FLOOR:
+                return ctx->device->pipeline_floor[dst->type == GGML_TYPE_F16];
             default:
                 break;
         }
@@ -11299,6 +11303,7 @@ static bool ggml_vk_build_graph(ggml_backend_vk_context * ctx, ggml_cgraph * cgr
         case GGML_UNARY_OP_STEP:
         case GGML_UNARY_OP_ROUND:
         case GGML_UNARY_OP_CEIL:
+        case GGML_UNARY_OP_FLOOR:
             break;
         default:
             return false;
@@ -11655,6 +11660,7 @@ static bool ggml_vk_build_graph(ggml_backend_vk_context * ctx, ggml_cgraph * cgr
         case GGML_UNARY_OP_STEP:
         case GGML_UNARY_OP_ROUND:
         case GGML_UNARY_OP_CEIL:
+        case GGML_UNARY_OP_FLOOR:
             ggml_vk_unary(ctx, compute_ctx, src0, node);
             break;
         default:
@@ -11935,6 +11941,7 @@ static bool ggml_vk_compute_forward(ggml_backend_vk_context * ctx, ggml_cgraph *
         case GGML_UNARY_OP_STEP:
         case GGML_UNARY_OP_ROUND:
         case GGML_UNARY_OP_CEIL:
+        case GGML_UNARY_OP_FLOOR:
             buf = tensor->buffer;
             break;
         default:
@@ -13541,6 +13548,7 @@ static bool ggml_backend_vk_device_supports_op(ggml_backend_dev_t dev, const ggm
                 case GGML_UNARY_OP_STEP:
                 case GGML_UNARY_OP_ROUND:
                 case GGML_UNARY_OP_CEIL:
+                case GGML_UNARY_OP_FLOOR:
                     return ggml_is_contiguous(op->src[0]) &&
                            (op->src[0]->type == GGML_TYPE_F32 || op->src[0]->type == GGML_TYPE_F16) &&
                            (op->type == GGML_TYPE_F32 || op->type == GGML_TYPE_F16) &&
@@ -14466,6 +14474,9 @@ static void ggml_vk_check_results_0(ggml_backend_vk_context * ctx, ggml_cgraph *
             case GGML_UNARY_OP_CEIL:
                 tensor_clone = ggml_ceil(ggml_ctx, src_clone[0]);
                 break;
+            case GGML_UNARY_OP_FLOOR:
+                tensor_clone = ggml_floor(ggml_ctx, src_clone[0]);
+                break;
             default:
                 std::cerr << "Missing vk_check_results OP: " << ggml_op_name(tensor->op) << std::endl;
                 GGML_ABORT("fatal error");
diff --git a/ggml/src/ggml-vulkan/vulkan-shaders/floor.comp b/ggml/src/ggml-vulkan/vulkan-shaders/floor.comp
@@ -0,0 +1,22 @@
+#version 450
+
+#include "generic_head.glsl"
+#include "types.glsl"
+
+#extension GL_EXT_control_flow_attributes : enable
+
+layout(local_size_x = 512, local_size_y = 1, local_size_z = 1) in;
+
+layout (binding = 0) readonly buffer X {A_TYPE data_a[];};
+layout (binding = 1) writeonly buffer D {D_TYPE data_d[];};
+
+void main() {
+    const uint i = gl_GlobalInvocationID.z * 262144 + gl_GlobalInvocationID.y * 512 + gl_GlobalInvocationID.x;
+
+    if (i >= p.KX) {
+        return;
+    }
+
+    const float x = float(data_a[i]);
+    data_d[i] = D_TYPE(floor(x));
+}
diff --git a/ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp b/ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp
@@ -857,6 +857,8 @@ void process_shaders() {
     string_to_spv("round_f32",      "round.comp",       {{"A_TYPE", "float"},       {"D_TYPE", "float"}});
     string_to_spv("ceil_f16",       "ceil.comp",        {{"A_TYPE", "float16_t"},   {"D_TYPE", "float16_t"}});
     string_to_spv("ceil_f32",       "ceil.comp",        {{"A_TYPE", "float"},       {"D_TYPE", "float"}});
+    string_to_spv("floor_f16",      "floor.comp",       {{"A_TYPE", "float16_t"},   {"D_TYPE", "float16_t"}});
+    string_to_spv("floor_f32",      "floor.comp",       {{"A_TYPE", "float"},       {"D_TYPE", "float"}});
 
     for (auto rte : {false, true}) {
         std::string suffix = rte ? "_rte" : "";