text-generation-inference

mirror of https://github.com/huggingface/text-generation-inference.git synced 2025-05-23 20:12:06 +00:00

Author	SHA1	Message	Date
baptiste	c3241f4279	enable multi-card test	2025-05-21 15:28:58 +00:00
baptiste	29b9c320fc	add new gaudi3 runners	2025-05-21 11:27:11 +00:00
baptiste	d22b2f325e	feat(gaudi/ci): added ci for gaudi device	2025-05-21 11:24:50 +00:00
baptiste	fb0a080a37	testing	2025-05-21 11:24:50 +00:00
baptiste	aad72cc0e3	change defualt behaviour to only run a subset of all the models	2025-05-21 11:24:50 +00:00
baptiste	a7d1309a46	change defualt behaviour to only run a subset of all the models	2025-05-21 11:24:50 +00:00
Baptiste Colle	923fcb95d5	wip(ci): debug the ci	2025-05-21 11:24:50 +00:00
Baptiste Colle	ad4dfa3a88	wip(ci): debug the ci	2025-05-21 11:24:50 +00:00
Pauline Bailly-Masson	646b9cfd19	Update tests.yaml	2025-05-21 11:24:50 +00:00
Pauline Bailly-Masson	7b79fc9c5b	Update tests.yaml	2025-05-21 11:24:50 +00:00
baptiste	bf1e5eafdb	wip(ci): rerun ci to debug	2025-05-21 11:24:50 +00:00
baptiste	24ce0c1176	fix llama failing test	2025-05-21 11:24:50 +00:00
baptiste	c777961877	feat(ci): llama3 test working	2025-05-21 11:24:50 +00:00
baptiste	fa832fc27c	feat(ci): llama3 test working	2025-05-21 11:24:50 +00:00
baptiste	ef241ab217	wip: able to launch gaudi tests	2025-05-21 11:24:50 +00:00
baptiste	8bb7da37d1	wip(test): adding test to ci	2025-05-21 11:24:50 +00:00
Wang, Yi	43b1b07fb9	Fix the crash in default ATTENTION path for Gaudi backend (#3235 ) Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-05-20 14:02:32 +02:00
Wang, Yi	000e313a92	Refine warmup and upgrade to synapse AI 1.21.0 (#3234 ) Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-05-20 10:22:43 +02:00
Wang, Yi	d658b5def3	Deepseek R1 for Gaudi backend (#3211 ) Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-05-19 16:36:39 +02:00
drbh	58934c8b61	fix: count gpu uuids if NVIDIA_VISIBLE_DEVICES env set to all (#3230 )	2025-05-16 11:48:58 -04:00
Yuan Wu	18cbecfb38	Enable Llama4 for Gaudi backend (#3223 ) Signed-off-by: yuanwu <yuan.wu@intel.com>	2025-05-15 14:35:37 +02:00
Daniël de Kok	7e531f413d	Update to Torch 2.7.0 (#3221 ) * Update to Torch 2.7.0 * Try to fix typer/click issue * Pin click to fix incompatibility with typer * Fix some test outputs with slight deviations * Attempt again to sync with CI * Mamba too * Fixup mllama Also switch to `unsloth/Llama-3.2-11B-Vision-Instruct` for testing from the EU :).	2025-05-15 11:48:33 +02:00
kaixuanliu	535ce23827	Adjust the `round_up_seq` logic in Gaudi backend (#3224 ) Signed-off-by: Liu, Kaixuan <kaixuan.liu@intel.com>	2025-05-12 09:58:43 +02:00
kaixuanliu	c94f415af4	Change HPU warmup logic: seq length should be with exponential growth (#3217 ) Signed-off-by: Liu, Kaixuan <kaixuan.liu@intel.com> Co-authored-by: regisss <15324346+regisss@users.noreply.github.com>	2025-05-10 15:41:18 +02:00
Daniël de Kok	56c8189467	Prepare for 3.3.0 (#3220 )	2025-05-09 15:50:29 +02:00
Mohit Sharma	329f612e55	Chunked Prefill VLM (#3188 ) * add logic * working * add encoder cache free * fixes * fix idefics * update pixel_values * add improvements * add improvements * improve * nit * fix inputs_embeds * nit * optimizations * add prometheus port * rename vars * rename vars * nit * disable chunking for qwen * review comments * remove port * improve headdim * remove kwargs and redundant args * fix qwen2_5 * fix config image_token_id error * fix test * update paligemma * fix paligemma text * minor fix * fix qwen test * fix qwen test	2025-05-06 18:01:59 +02:00
Wang, Yi	533eee50dc	forward and tokenize chooser use the same shape (#3196 ) * forward and tokenize chooser use the same shape concate or filter happened to cpu tensor to avoid dynamic shape in hpu Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * use hpu set seed Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> --------- Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-05-06 10:49:32 +02:00
Wang, Yi	51a0b9d11c	IPEX support FP8 kvcache/softcap/slidingwindow (#3144 ) * IPEX support FP8 kvcache Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add kvcache dtype Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add softcap and slidingwindow Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * kv scale in pageattn Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove triton installation, will be installed with torch Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * install xelink lib Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * softcap default -1.0 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * softcap default -1.0 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> --------- Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-05-06 10:49:24 +02:00
regisss	f208ba6afc	Fix `HF_HUB_OFFLINE=1` for Gaudi backend (#3193 ) * Fix `HF_HUB_OFFLINE=1` for Gaudi backend * Fix HF cache default value in server.rs * Format	2025-05-06 10:47:53 +02:00
Julien Chaumond	7253be349a	Update client SDK snippets (#3207 ) * Update client SDK snippets * good catch from copilot	2025-05-01 17:10:51 +02:00
drbh	d303c1e37e	fix: bump snaps for mllama (#3202 )	2025-05-01 10:20:45 -04:00
drbh	12ea8d74c7	Pr 2982 ci branch (#3046 ) * Add json_schema alias for GrammarType * Add tests for all aliases * fix: various linter adjustments * fix: end-of-file-fixer lint * fix: add test snapshots and avoid docs change * fix: another end-of-file-fixer lint * feat: support json_schema grammar constraining and add tests * fix: bump openapi doc with new grammar option * fix: adjust test payload * fix: bump test snaps --------- Co-authored-by: Alex Weston <alexw@alkymi.io>	2025-05-01 10:17:16 -04:00
Julien Chaumond	6afe4307ab	doc typo (#3206 ) typo	2025-05-01 14:31:48 +02:00
Alvaro Bartolome	40dfce644a	Skip `{% generation %}` and `{% endgeneration %}` template handling (#3204 ) * Add `.DS_Store` file to `.gitignore` * Skip `{% generation %}` and `{% endgeneration %}` Custom syntax within the chat template for the Phi4 Reasoning models e.g. https://huggingface.co/microsoft/Phi-4-reasoning-plus, which is AFAIK not handled natively yet, so skipping for now * Update explanation on `{% generation %}` and `{% endgeneration %}` removal * Revert "Add `.DS_Store` file to `.gitignore`" This reverts commit `d64d6d2f7f`.	2025-05-01 12:13:17 +02:00
Nicolas Patry	e7329fec18	Fixing the router + template for Qwen3. (#3200 )	2025-04-29 16:29:26 +02:00
Nicolas Patry	39cfe232fd	Put more wiggle room. (#3189 ) * Put more wiggle room. * Fixing the makefile by using lockfile. * Pre commit	2025-04-24 17:23:32 +02:00
Wang, Yi	375802948d	Warmup gaudi backend (#3172 ) * clean cuda/rocm code in hpu backend, enable flat_hpu Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix TP in pageattn Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * adjust block table in hpu to improve performance Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable all the model. not testet yet Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * use tensor cache in hpu graph to avoid replay issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add moe support, fix qwen/mistral/mixtral crash Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix phimoe issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * gpt_bigcode could also go pageattn Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable dbrx remove some unused code Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * multi-modality initial PR Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * adjust warmup and enable vlm Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix incorrect output in qwen2 idefics if hpu graph is used Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove unused quantization code and enable awq/gptq int4 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix gptq issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable fp8 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * warmup prefill remove model where pageattn is not used, set block table to None since it's not used Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add warmup_decode Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * warmup decode Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove block_tables and prefill_cache_indices which will lead to dynamic shape Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix comment Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * missing gptj change... Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix some issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove torch.where to fix incorrect output in hpu graph model Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * LLM warmup logic Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * multi-modality warmup Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * optimize code Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * refine log and fix some issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix warmup issue for mllama Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * pingpong optimization Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * match the latest vllm_extension ops Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * work with the latest vllm extension ops Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove block_scales which is not needed anymore Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * improve performance Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * prefill bypass graph Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * pingpong optimization issue fix Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> --------- Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-04-24 09:57:08 +02:00
Mohit Sharma	02715dc53f	Add option to configure prometheus port (#3187 ) * add prometheus port * fix doc * add port for trtllm and llamacpp * Fixing format after rebase. --------- Co-authored-by: Nicolas Patry <patry.nicolas@protonmail.com>	2025-04-23 20:43:25 +05:30
Nicolas Patry	8f8819795f	Fixing CI (#3184 )	2025-04-18 13:07:18 +02:00
Alvaro Bartolome	95ccba3705	Bump `sccache` to 0.10.0 (#3179 ) * Ensure that `sccache` version is 0.10.0 or higher * Rename `ACTIONS_CACHE_URL` to `ACTIONS_RESULTS_URL`	2025-04-18 12:45:32 +02:00
Hyeongchan Kim	b400c275e4	Get opentelemetry trace id from request headers instead of creating a new trace (#2648 ) feature: get trace id from req headers Co-authored-by: Nicolas Patry <patry.nicolas@protonmail.com>	2025-04-18 09:06:41 +02:00
Daniël de Kok	84ab88d843	Support flashinfer for Gemma3 prefill (#3167 ) * launcher: ensure correct detection of Gemma 3 head size * Support flashinfer for Gemma3 prefill Gemma3 uses bidirectional attention for images. Flashinfer supports custom masks. Hook up the mask with flashinfer, so that we do not have to use the slower SDPA implementation for prefills with images. * Update Gemma3 test outputs * Fixed unused import	2025-04-17 18:07:41 +02:00
Nicolas Patry	4645678ff0	Hotfix gaudi2 with newer transformers. (#3176 )	2025-04-15 12:39:28 +02:00
Nicolas Patry	ad765cd06b	Hotfixing gaudi deps. (#3174 )	2025-04-15 11:55:28 +02:00
Nicolas Patry	16b4b7974a	Upgrading the dependencies in Gaudi backend. (#3170 ) * Upgrading the dependencies in Gaudi backend. * Upgrading transformers version.	2025-04-15 11:49:06 +02:00
Wang, Yi	459fbdebe3	transformers flash llm/vlm enabling in ipex (#3152 ) * transformers flash llm/vlm enabling in xpu Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * ipex cpu could also support in function Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> --------- Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-04-15 11:08:01 +02:00
Nicolas Patry	449cee49ca	setuptools <= 70.0 is vulnerable: CVE-2024-6345 (#3171 )	2025-04-15 10:09:37 +02:00
Mohit Sharma	73e797528d	L4 fixes (#3161 ) add fix	2025-04-14 22:13:53 +05:30
Nicolas Patry	fe56f760df	Upgrading the python client deps (still deprecated, but used for integration-tests)	2025-04-14 17:18:43 +02:00
Wang, Yi	d62c941c56	Gaudi: clean cuda/rocm code in hpu backend, enable flat_hpu (#3113 ) * clean cuda/rocm code in hpu backend, enable flat_hpu Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix TP in pageattn Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * adjust block table in hpu to improve performance Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable all the model. not testet yet Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * use tensor cache in hpu graph to avoid replay issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add moe support, fix qwen/mistral/mixtral crash Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix phimoe issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * gpt_bigcode could also go pageattn Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable dbrx remove some unused code Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * multi-modality initial PR Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * adjust warmup and enable vlm Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix incorrect output in qwen2 idefics if hpu graph is used Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove unused quantization code and enable awq/gptq int4 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix gptq issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * enable fp8 Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * warmup prefill remove model where pageattn is not used, set block table to None since it's not used Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * add warmup_decode Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * warmup decode Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove block_tables and prefill_cache_indices which will lead to dynamic shape Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix comment Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * missing gptj change... Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * fix some issue Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * remove torch.where to fix incorrect output in hpu graph model Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> * match the latest vllm_extension ops Signed-off-by: Wang, Yi A <yi.a.wang@intel.com> --------- Signed-off-by: Wang, Yi A <yi.a.wang@intel.com>	2025-04-14 15:58:13 +02:00

1 2 3 4 5 ...

1406 Commits