Mở bài viết
6,12 tỷ request LLM đã nói gì về Cache, Load Balancing và cách chúng ta đang phục vụ AI?
Phân tích paper A Year in LLM Serving từ hơn 6 tỷ request production: workload LLM không đứng yên, request count có thể đánh lừa, prefix cache mang tính thời gian rất mạnh và cache...