text-generation-inference/server/text_generation_server/server.py

# Copyright (C) 2024 Habana Labs, Ltd. an Intel Company.

import asyncio
import os
import sys
import torch
import time

from grpc import aio
from loguru import logger

from grpc_reflection.v1alpha import reflection
from pathlib import Path
from typing import List, Optional

from text_generation_server.cache import Cache
from text_generation_server.interceptor import ExceptionInterceptor
from text_generation_server.models import Model, get_model
from text_generation_server.pb import generate_pb2_grpc, generate_pb2
from text_generation_server.tracing import UDSOpenTelemetryAioServerInterceptor


class TextGenerationService(generate_pb2_grpc.TextGenerationServiceServicer):
    def __init__(
        self,
        model: Model,
        cache: Cache,
        server_urls: List[str],
    ):
        self.cache = cache
        self.model = model
        self.server_urls = server_urls
        # For some reason, inference_mode does not work well with GLOO which we use on CPU
        # TODO: The inferecemode set messes up the autograd op dispatch. And results in aten::matmul
        # op not optimized issue. Will investigate further.
        # if model.device.type == "hpu":
        # Force inference mode for the lifetime of TextGenerationService
        # self._inference_mode_raii_guard = torch._C._InferenceMode(True)

    async def Info(self, request, context):
        return self.model.info

    async def Health(self, request, context):
        if self.model.device.type == "hpu":
            torch.zeros((2, 2)).to("hpu")
        return generate_pb2.HealthResponse()

    async def ServiceDiscovery(self, request, context):
        return generate_pb2.ServiceDiscoveryResponse(urls=self.server_urls)

    async def ClearCache(self, request, context):
        if request.HasField("id"):
            self.cache.delete(request.id)
        else:
            self.cache.clear()
        return generate_pb2.ClearCacheResponse()

    async def FilterBatch(self, request, context):
        batch = self.cache.pop(request.batch_id)
        if batch is None:
            raise ValueError(f"Batch ID {request.batch_id} not found in cache.")
        filtered_batch = batch.filter(request.request_ids)
        self.cache.set(filtered_batch)

        return generate_pb2.FilterBatchResponse(batch=filtered_batch.to_pb())

    async def Warmup(self, request, context):
        def batch_from_pb(batch):
            return self.model.batch_type.from_pb(
                batch, self.model.tokenizer, self.model.dtype, self.model.device
            )

        batches = [batch_from_pb(batch) for batch in request.batches]
        self.model.warmup(batches)

        return generate_pb2.WarmupResponse()

    async def Prefill(self, request, context):
        start = time.time_ns()
        batch = self.model.batch_type.from_pb(
            request.batch, self.model.tokenizer, self.model.dtype, self.model.device
        )
        generations, next_batch, timings = self.model.generate_token([batch])
        self.cache.set(next_batch)

        return generate_pb2.PrefillResponse(
            generations=[generation.to_pb() for generation in generations],
            batch=next_batch.to_pb() if next_batch else None,
            forward_ns=timings[0],
            decode_ns=timings[1],
            total_ns=time.time_ns() - start,
        )

    async def Decode(self, request, context):
        start = time.time_ns()
        if len(request.batches) == 0:
            raise ValueError("Must provide at least one batch")

        batches = []
        for batch_pb in request.batches:
            batch = self.cache.pop(batch_pb.id)
            if batch is None:
                raise ValueError(f"Batch ID {batch_pb.id} not found in cache.")
            batches.append(batch)

        if len(batches) == 0:
            raise ValueError("All batches are empty")

        generations, next_batch, timings = self.model.generate_token(batches)
        self.cache.set(next_batch)

        return generate_pb2.DecodeResponse(
            generations=[generation.to_pb() for generation in generations],
            batch=next_batch.to_pb() if next_batch else None,
            concat_ns=None, # TODO: measure concat time
            forward_ns=timings[0],
            decode_ns=timings[1],
            total_ns=time.time_ns() - start,
        )


def serve(
    model_id: str,
    revision: Optional[str],
    sharded: bool,
    speculate: Optional[int],
    dtype: Optional[str],
    trust_remote_code: bool,
    uds_path: Path,
):
    # Remove default handler
    logger.remove()
    logger.add(
        sys.stdout,
        format="{message}",
        filter="text_generation_server",
        level="INFO",
        serialize=False,
        backtrace=True,
        diagnose=False,
    )

    async def serve_inner(
        model_id: str,
        revision: Optional[str],
        sharded: bool = False,
        speculate: Optional[int] = None,
        dtype: Optional[str] = None,
        trust_remote_code: bool = False,
    ):
        unix_socket_template = "unix://{}-{}"
        logger.info("Server:server_inner: sharded ={}".format(sharded))

        if sharded:
            rank = int(os.environ["RANK"])
            logger.info("Server:server_inner: rank ={}".format(rank))
            server_urls = [
                unix_socket_template.format(uds_path, rank) for rank in range(int(os.environ["WORLD_SIZE"]))
            ]
            local_url = server_urls[int(os.environ["RANK"])]
        else:
            local_url = unix_socket_template.format(uds_path, 0)
            server_urls = [local_url]

        logger.info("Server:server_inner: data type = {}, local_url = {}".format(dtype, local_url))
        if dtype == "bfloat16" or None:
            data_type = torch.bfloat16
        else:
            data_type = torch.float
        if revision == "None":
            revision = None
        try:
            model = get_model(
                model_id,
                revision,
                speculate,
                data_type,
                trust_remote_code
            )
        except Exception:
            logger.exception("Error when initializing model")
            raise

        server = aio.server(
            interceptors=[
                ExceptionInterceptor(),
                UDSOpenTelemetryAioServerInterceptor(),
            ]
        )
        generate_pb2_grpc.add_TextGenerationServiceServicer_to_server(
            TextGenerationService(model, Cache(), server_urls), server
        )
        SERVICE_NAMES = (
            generate_pb2.DESCRIPTOR.services_by_name["TextGenerationService"].full_name,
            reflection.SERVICE_NAME,
        )
        reflection.enable_server_reflection(SERVICE_NAMES, server)
        server.add_insecure_port(local_url)

        await server.start()

        logger.info("Server started at {}".format(local_url))

        try:
            await server.wait_for_termination()
        except KeyboardInterrupt:
            logger.info("Signal received. Shutting down")
            await server.stop(0)

    asyncio.run(
        serve_inner(
            model_id, revision, sharded, speculate, dtype, trust_remote_code
        )
    )
Add Habana copyright header (#122) Co-authored-by: Karol Damaszke <kdamaszke@habana.ai> 2024-04-08 16:06:21 +00:00			`# Copyright (C) 2024 Habana Labs, Ltd. an Intel Company.`

Init 2022-10-08 10:30:12 +00:00			`import asyncio`
feat: Improve error handling 2022-10-17 12:59:00 +00:00			`import os`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`import sys`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00			`import torch`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`import time`
feat: Improve error handling 2022-10-17 12:59:00 +00:00
Init 2022-10-08 10:30:12 +00:00			`from grpc import aio`
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 11:01:23 +00:00			`from loguru import logger`
Init 2022-10-08 10:30:12 +00:00
			`from grpc_reflection.v1alpha import reflection`
			`from pathlib import Path`
feat(server): Support GPT-Neox (#39) 2023-01-31 17:53:56 +00:00			`from typing import List, Optional`
Init 2022-10-08 10:30:12 +00:00
feat(clients): Python client (#103) 2023-03-07 17:52:22 +00:00			`from text_generation_server.cache import Cache`
			`from text_generation_server.interceptor import ExceptionInterceptor`
			`from text_generation_server.models import Model, get_model`
			`from text_generation_server.pb import generate_pb2_grpc, generate_pb2`
			`from text_generation_server.tracing import UDSOpenTelemetryAioServerInterceptor`
Init 2022-10-08 10:30:12 +00:00
feat: format code (#1070) 2023-09-27 10:22:09 +00:00
Refactored gRPC interface Added validation logic 2022-10-11 14:50:54 +00:00			`class TextGenerationService(generate_pb2_grpc.TextGenerationServiceServicer):`
fix: fix gpt-q with groupsize = -1 (#1358) 2023-12-18 15:07:05 +00:00			`def __init__(`
			`self,`
			`model: Model,`
			`cache: Cache,`
			`server_urls: List[str],`
			`):`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`self.cache = cache`
			`self.model = model`
			`self.server_urls = server_urls`
			`# For some reason, inference_mode does not work well with GLOO which we use on CPU`
			`# TODO: The inferecemode set messes up the autograd op dispatch. And results in aten::matmul`
			`# op not optimized issue. Will investigate further.`
			`# if model.device.type == "hpu":`
			`# Force inference mode for the lifetime of TextGenerationService`
			`# self._inference_mode_raii_guard = torch._C._InferenceMode(True)`
Init 2022-10-08 10:30:12 +00:00
feat(router): add device and dtype info (#215) 2023-04-21 13:36:29 +00:00			`async def Info(self, request, context):`
			`return self.model.info`

feat(router): new healthcheck that skips the queue (#244) Co-authored-by: OlivierDehaene <23298448+OlivierDehaene@users.noreply.github.com> Co-authored-by: OlivierDehaene <olivier@huggingface.co> 2023-04-26 18:23:54 +00:00			`async def Health(self, request, context):`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`if self.model.device.type == "hpu":`
			`torch.zeros((2, 2)).to("hpu")`
feat(router): new healthcheck that skips the queue (#244) Co-authored-by: OlivierDehaene <23298448+OlivierDehaene@users.noreply.github.com> Co-authored-by: OlivierDehaene <olivier@huggingface.co> 2023-04-26 18:23:54 +00:00			`return generate_pb2.HealthResponse()`

Init 2022-10-08 10:30:12 +00:00			`async def ServiceDiscovery(self, request, context):`
			`return generate_pb2.ServiceDiscoveryResponse(urls=self.server_urls)`

			`async def ClearCache(self, request, context):`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`if request.HasField("id"):`
			`self.cache.delete(request.id)`
			`else:`
			`self.cache.clear()`
			`return generate_pb2.ClearCacheResponse()`
Init 2022-10-08 10:30:12 +00:00
feat(router): use number of tokens in batch as input for dynamic batching (#226) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-04-24 15:59:00 +00:00			`async def FilterBatch(self, request, context):`
			`batch = self.cache.pop(request.batch_id)`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`if batch is None:`
			`raise ValueError(f"Batch ID {request.batch_id} not found in cache.")`
			`filtered_batch = batch.filter(request.request_ids)`
			`self.cache.set(filtered_batch)`
feat(router): use number of tokens in batch as input for dynamic batching (#226) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-04-24 15:59:00 +00:00
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`return generate_pb2.FilterBatchResponse(batch=filtered_batch.to_pb())`
feat(router): use number of tokens in batch as input for dynamic batching (#226) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-04-24 15:59:00 +00:00
feat(server): add paged attention to flash models (#516) Closes #478 2023-06-30 17:09:59 +00:00			`async def Warmup(self, request, context):`
Add warmup for all possible shapes for prefill #49 (#81) 2024-02-28 09:40:13 +00:00			`def batch_from_pb(batch):`
			`return self.model.batch_type.from_pb(`
Add support for rope_scaling and remove is_optimized_for_gaudi (#112) Co-authored-by: Karol Damaszke <kdamaszke@habana.ai> 2024-03-29 14:07:32 +00:00			`batch, self.model.tokenizer, self.model.dtype, self.model.device`
Add warmup for all possible shapes for prefill #49 (#81) 2024-02-28 09:40:13 +00:00			`)`

Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`batches = [batch_from_pb(batch) for batch in request.batches]`
			`self.model.warmup(batches)`
Add warmup for all possible shapes for prefill #49 (#81) 2024-02-28 09:40:13 +00:00
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`return generate_pb2.WarmupResponse()`
feat(server): add paged attention to flash models (#516) Closes #478 2023-06-30 17:09:59 +00:00
feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 16:04:00 +00:00			`async def Prefill(self, request, context):`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`start = time.time_ns()`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`batch = self.model.batch_type.from_pb(`
Add support for rope_scaling and remove is_optimized_for_gaudi (#112) Co-authored-by: Karol Damaszke <kdamaszke@habana.ai> 2024-03-29 14:07:32 +00:00			`request.batch, self.model.tokenizer, self.model.dtype, self.model.device`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`)`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`generations, next_batch, timings = self.model.generate_token([batch])`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`self.cache.set(next_batch)`

			`return generate_pb2.PrefillResponse(`
			`generations=[generation.to_pb() for generation in generations],`
			`batch=next_batch.to_pb() if next_batch else None,`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`forward_ns=timings[0],`
			`decode_ns=timings[1],`
			`total_ns=time.time_ns() - start,`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`)`
Init 2022-10-08 10:30:12 +00:00
feat: Add token streaming using ServerSideEvents support (#41) 2023-01-31 16:04:00 +00:00			`async def Decode(self, request, context):`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`start = time.time_ns()`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`if len(request.batches) == 0:`
			`raise ValueError("Must provide at least one batch")`

			`batches = []`
			`for batch_pb in request.batches:`
			`batch = self.cache.pop(batch_pb.id)`
			`if batch is None:`
			`raise ValueError(f"Batch ID {batch_pb.id} not found in cache.")`
			`batches.append(batch)`

			`if len(batches) == 0:`
			`raise ValueError("All batches are empty")`

feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`generations, next_batch, timings = self.model.generate_token(batches)`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`self.cache.set(next_batch)`

			`return generate_pb2.DecodeResponse(`
			`generations=[generation.to_pb() for generation in generations],`
			`batch=next_batch.to_pb() if next_batch else None,`
feat: add more latency metrics in forward (#1346) 2023-12-14 14:59:38 +00:00			`concat_ns=None, # TODO: measure concat time`
			`forward_ns=timings[0],`
			`decode_ns=timings[1],`
			`total_ns=time.time_ns() - start,`
Overhead reduction (#58) (#85) Co-authored-by: mrs303 <54661797+mrs303@users.noreply.github.com> 2024-02-29 08:17:45 +00:00			`)`
Refactored gRPC interface Added validation logic 2022-10-11 14:50:54 +00:00
Init 2022-10-08 10:30:12 +00:00
v0.1.0 2022-10-18 13:19:03 +00:00			`def serve(`
fix(server): fix quantization python requirements (#708) 2023-07-27 10:28:10 +00:00			`model_id: str,`
			`revision: Optional[str],`
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`sharded: bool,`
			`speculate: Optional[int],`
fix(server): fix quantization python requirements (#708) 2023-07-27 10:28:10 +00:00			`dtype: Optional[str],`
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`trust_remote_code: bool,`
fix(server): fix quantization python requirements (#708) 2023-07-27 10:28:10 +00:00			`uds_path: Path,`
fix(server): fix exllama buffers (#689) Close #683 2023-07-24 12:25:43 +00:00			`):`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`# Remove default handler`
			`logger.remove()`
			`logger.add(`
			`sys.stdout,`
			`format="{message}",`
			`filter="text_generation_server",`
			`level="INFO",`
			`serialize=False,`
			`backtrace=True,`
			`diagnose=False,`
			`)`

fix(server): fix exllama buffers (#689) Close #683 2023-07-24 12:25:43 +00:00			`async def serve_inner(`
fix(server): fix quantization python requirements (#708) 2023-07-27 10:28:10 +00:00			`model_id: str,`
			`revision: Optional[str],`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`sharded: bool = False,`
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`speculate: Optional[int] = None,`
			`dtype: Optional[str] = None,`
			`trust_remote_code: bool = False,`
Init 2022-10-08 10:30:12 +00:00			`):`
v0.1.0 2022-10-18 13:19:03 +00:00			`unix_socket_template = "unix://{}-{}"`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`logger.info("Server:server_inner: sharded ={}".format(sharded))`

Init 2022-10-08 10:30:12 +00:00			`if sharded:`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`rank = int(os.environ["RANK"])`
			`logger.info("Server:server_inner: rank ={}".format(rank))`
Init 2022-10-08 10:30:12 +00:00			`server_urls = [`
Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`unix_socket_template.format(uds_path, rank) for rank in range(int(os.environ["WORLD_SIZE"]))`
Init 2022-10-08 10:30:12 +00:00			`]`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 17:24:00 +00:00			`local_url = server_urls[int(os.environ["RANK"])]`
Init 2022-10-08 10:30:12 +00:00			`else:`
v0.1.0 2022-10-18 13:19:03 +00:00			`local_url = unix_socket_template.format(uds_path, 0)`
Init 2022-10-08 10:30:12 +00:00			`server_urls = [local_url]`

Add changes from Optimum Habana's TGI folder 2023-12-05 10:12:16 +00:00			`logger.info("Server:server_inner: data type = {}, local_url = {}".format(dtype, local_url))`
			`if dtype == "bfloat16" or None:`
			`data_type = torch.bfloat16`
			`else:`
			`data_type = torch.float`
Fix for continuous batching (#1) 2023-12-11 08:24:09 +00:00			`if revision == "None":`
			`revision = None`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00			`try:`
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`model = get_model(`
chore: formatting 2023-12-11 13:49:52 +00:00			`model_id,`
			`revision,`
			`speculate,`
			`data_type,`
			`trust_remote_code`
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`)`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00			`except Exception:`
			`logger.exception("Error when initializing model")`
			`raise`
feat(server): Support all AutoModelForCausalLM on a best effort basis 2022-10-28 17:24:00 +00:00
feat: add distributed tracing (#62) 2023-02-13 12:02:45 +00:00			`server = aio.server(`
			`interceptors=[`
			`ExceptionInterceptor(),`
			`UDSOpenTelemetryAioServerInterceptor(),`
			`]`
			`)`
Refactored gRPC interface Added validation logic 2022-10-11 14:50:54 +00:00			`generate_pb2_grpc.add_TextGenerationServiceServicer_to_server(`
			`TextGenerationService(model, Cache(), server_urls), server`
Init 2022-10-08 10:30:12 +00:00			`)`
			`SERVICE_NAMES = (`
Refactored gRPC interface Added validation logic 2022-10-11 14:50:54 +00:00			`generate_pb2.DESCRIPTOR.services_by_name["TextGenerationService"].full_name,`
Init 2022-10-08 10:30:12 +00:00			`reflection.SERVICE_NAME,`
			`)`
			`reflection.enable_server_reflection(SERVICE_NAMES, server)`
			`server.add_insecure_port(local_url)`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00
Init 2022-10-08 10:30:12 +00:00			`await server.start()`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 11:01:23 +00:00			`logger.info("Server started at {}".format(local_url))`
fix(server): better handling of inference mode (#57) 2023-02-07 14:38:22 +00:00
v0.1.0 2022-10-18 13:19:03 +00:00			`try:`
			`await server.wait_for_termination()`
			`except KeyboardInterrupt:`
feat(launcher): Log server stdout (#19) Co-authored-by: Nick Hill <nickhill@us.ibm.com> 2023-01-05 11:01:23 +00:00			`logger.info("Signal received. Shutting down")`
v0.1.0 2022-10-18 13:19:03 +00:00			`await server.stop(0)`
Init 2022-10-08 10:30:12 +00:00
Speculative (#1308) 2023-12-11 11:46:30 +00:00			`asyncio.run(`
chore: formatting 2023-12-11 13:49:52 +00:00			`serve_inner(`
			`model_id, revision, sharded, speculate, dtype, trust_remote_code`
			`)`
feat: Add the option to force another dtype than `f16`. (#513) 2023-06-30 18:30:09 +00:00			`)`