IndexCache: Пришвидчте висновки моделей ШІ з довгим контекстом у 1.82 рази

Обробка 200 000 токенів за допомогою великої мовної моделі є дорогою та повільною: чим довший контекст, тим швидше зростають витрати. Дослідники з Університету Цінхуа та Z.ai розробили техніку під назвою IndexCache, яка скорочує до 75% надлишкових обчислень у моделях зі…










