Merge remote-tracking branch 'origin/main' into feat/flash_llama

2025-09-10 20:04:52 +00:00 · 2023-04-09 20:24:16 +02:00 · 2023-04-09 20:24:16 +02:00 · a1a6b5cc20
commit a1a6b5cc20
parent 7451196a78 9987960062
1 changed files with 69 additions and 69 deletions
--- a/router/src/server.rs
+++ b/router/src/server.rs
@ -87,21 +87,21 @@ async fn health(infer: Extension<Infer>) -> Result<(), (StatusCode, Json<ErrorRe
 /// Generate tokens
 #[utoipa::path(
-    post,
+post,
-    tag = "Text Generation Inference",
+tag = "Text Generation Inference",
-    path = "/generate",
+path = "/generate",
-    request_body = GenerateRequest,
+request_body = GenerateRequest,
-    responses(
+responses(
-        (status = 200, description = "Generated Text", body = GenerateResponse),
+(status = 200, description = "Generated Text", body = GenerateResponse),
-        (status = 424, description = "Generation Error", body = ErrorResponse,
+(status = 424, description = "Generation Error", body = ErrorResponse,
-            example = json ! ({"error": "Request failed during generation"})),
+example = json ! ({"error": "Request failed during generation"})),
-        (status = 429, description = "Model is overloaded", body = ErrorResponse,
+(status = 429, description = "Model is overloaded", body = ErrorResponse,
-            example = json ! ({"error": "Model is overloaded"})),
+example = json ! ({"error": "Model is overloaded"})),
-        (status = 422, description = "Input validation error", body = ErrorResponse,
+(status = 422, description = "Input validation error", body = ErrorResponse,
-            example = json ! ({"error": "Input validation error"})),
+example = json ! ({"error": "Input validation error"})),
-        (status = 500, description = "Incomplete generation", body = ErrorResponse,
+(status = 500, description = "Incomplete generation", body = ErrorResponse,
-            example = json ! ({"error": "Incomplete generation"})),
+example = json ! ({"error": "Incomplete generation"})),
-    )
+)
 )]
 #[instrument(
    skip(infer),
@ -264,26 +264,26 @@ async fn generate(
 /// Generate a stream of token using Server-Sent Events
 #[utoipa::path(
-    post,
+post,
-    tag = "Text Generation Inference",
+tag = "Text Generation Inference",
-    path = "/generate_stream",
+path = "/generate_stream",
-    request_body = GenerateRequest,
+request_body = GenerateRequest,
-    responses(
+responses(
-        (status = 200, description = "Generated Text", body = StreamResponse,
+(status = 200, description = "Generated Text", body = StreamResponse,
-            content_type = "text/event-stream"),
+content_type = "text/event-stream"),
-        (status = 424, description = "Generation Error", body = ErrorResponse,
+(status = 424, description = "Generation Error", body = ErrorResponse,
-            example = json ! ({"error": "Request failed during generation"}),
+example = json ! ({"error": "Request failed during generation"}),
-            content_type = "text/event-stream"),
+content_type = "text/event-stream"),
-        (status = 429, description = "Model is overloaded", body = ErrorResponse,
+(status = 429, description = "Model is overloaded", body = ErrorResponse,
-            example = json ! ({"error": "Model is overloaded"}),
+example = json ! ({"error": "Model is overloaded"}),
-            content_type = "text/event-stream"),
+content_type = "text/event-stream"),
-        (status = 422, description = "Input validation error", body = ErrorResponse,
+(status = 422, description = "Input validation error", body = ErrorResponse,
-            example = json ! ({"error": "Input validation error"}),
+example = json ! ({"error": "Input validation error"}),
-            content_type = "text/event-stream"),
+content_type = "text/event-stream"),
-        (status = 500, description = "Incomplete generation", body = ErrorResponse,
+(status = 500, description = "Incomplete generation", body = ErrorResponse,
-            example = json ! ({"error": "Incomplete generation"}),
+example = json ! ({"error": "Incomplete generation"}),
-            content_type = "text/event-stream"),
+content_type = "text/event-stream"),
-    )
+)
 )]
 #[instrument(
    skip(infer),
@ -447,10 +447,10 @@ async fn generate_stream(
 /// Prometheus metrics scrape endpoint
 #[utoipa::path(
-    get,
+get,
-    tag = "Text Generation Inference",
+tag = "Text Generation Inference",
-    path = "/metrics",
+path = "/metrics",
-    responses((status = 200, description = "Prometheus Metrics", body = String))
+responses((status = 200, description = "Prometheus Metrics", body = String))
 )]
 async fn metrics(prom_handle: Extension<PrometheusHandle>) -> String {
    prom_handle.render()