Hugging Face a anunțat o actualizare semnificativă pentru framework-ul său Text Generation Inference (TGI), introducând suport nativ pentru multiple backend-uri, în special NVIDIA TensorRT-LLM și vLLM. Această inițiativă vizează oferirea unui set de instrumente mai versatil pentru dezvoltatorii care implementează modele de limbaj de mari dimensiuni (LLM) în medii de producție.
Performanță și flexibilitate sporite
Prin integrarea TensorRT-LLM, utilizatorii TGI pot acum să profite de biblioteca optimizată a NVIDIA pentru inferența deep learning, concepută pentru a maximiza fluxul de date și a reduce latența pe unitățile de procesare grafică (GPU) NVIDIA. În paralel, adăugarea suportului vLLM aduce un management eficient al memoriei prin PagedAttention, o tehnică ce îmbunătățește semnificativ utilizarea hardware-ului în timpul sarcinilor de lucru cu un nivel ridicat de concurență.
Implementare simplificată
Introducerea acestor backend-uri permite echipelor tehnice să comute între motoarele de optimizare fără a modifica structura API-ului de bază. Acest lucru asigură faptul că TGI rămâne o interfață unificată pentru servirea modelelor, permițând în același timp utilizatorilor să aleagă backend-ul specific care se potrivește cel mai bine constrângerilor hardware și cerințelor de performanță.


