Mở bài viết
AirLLM: Nhét một mô hình 2.8 nghìn tỷ tham số qua khe cửa 4GB VRAM
AirLLM không làm mô hình nhỏ đi. Nó biến GPU thành một căn phòng nhỏ, chỉ đưa từng layer hoặc từng expert vào tính toán rồi lập tức đẩy ra ngoài. Đổi lại, VRAM giảm cực mạnh nhưng...