Google TurboQuant: Algorytm, który zmieści potężne AI w Twoim telefonie
Google zaprezentowało algorytm bezstratnej kompresji KV cache. Co to oznacza dla prywatności i szybkości AI na smartfonach?
Był kiedyś taki serial - Dolina Krzemowa, ktoś pamięta? Opowiadał o startupie Pied Piper który próbował stworzyć algorytm bezstratnej kompresji, który miał wywrócić świat technologii do góry nogami. To była oczywiście fikcja. Ale Google niedawno zaprezentowało coś, co jednoznacznie kojarzy się z takim właśnie rozwiązaniem. I do tego udostępnili to wszystkim za darmo! Problem: Wąskie gardło pamięci Kiedy piszesz z AI, model zapisuje całą waszą rozmowę w tymczasowej pamięci (tzw. KV cache). Przy długiej rozmowie, ta "ściągawka" dla jednego użytkownika potrafi zżerać 40 GB pamięci. Czyli połowę serwerowej karty graficznej za 30 000$. Tylko po to, żeby model pamiętał, że godzinę temu prosiłeś go o tabelkę w Excelu. Gdy pamięć w chmurze się zapycha - system nie przyjmuje nowych zapytań. To obecnie największe "wąskie gardło" AI.