{"apiVersion":"1.0","identifier":"CVE-2026-71486","description":"vLLM is an inference and serving engine for large language models. Prior to 0.26.0, the /v1/completions/derender and /v1/chat/completions/derender endpoints accept caller-supplied GenerateResponse objects whose generate_responses, choices, token_ids, prompt_logprobs, logprobs.content, top_logprobs, and routed_experts structures are processed by OnlineDerenderer and tokenizer.decode before max_model_len, max_tokens, max_num_seqs, or response-size limits are enforced, allowing an authenticated API client to consume excessive CPU and memory and produce oversized responses. This issue is fixed in version 0.26.0.","publishedAt":"2026-08-17T20:16:45","lastModifiedAt":"2026-08-18T13:17:29","sourceUrl":"https://nvd.nist.gov/vuln/detail/CVE-2026-71486","cvssScore":4.3,"cvssVector":"CVSS:3.1/AV:N/AC:L/PR:L/UI:N/S:U/C:N/I:N/A:L","epssProbability":0.00341,"riskScore":0.44,"affectedProduct":"vLLM","affectedVersions":"<0.26.0","vulnerabilityType":"Library","operatingSystems":[],"links":{"self":"https://www.redsauce.net/api/cves/CVE-2026-71486","webPages":{"es":"https://www.redsauce.net/es/cves/CVE-2026-71486","en":"https://www.redsauce.net/en/cves/CVE-2026-71486","fr":"https://www.redsauce.net/fr/cves/CVE-2026-71486","pt":"https://www.redsauce.net/pt/cves/CVE-2026-71486","de":"https://www.redsauce.net/de/cves/CVE-2026-71486","sk":"https://www.redsauce.net/sk/cves/CVE-2026-71486","el":"https://www.redsauce.net/el/cves/CVE-2026-71486"},"source":"https://nvd.nist.gov/vuln/detail/CVE-2026-71486"}}