Data Science. SQL hub
35.9K subscribers
1.16K photos
96 videos
37 files
1.17K links
По всем вопросам- @workakkk

@itchannels_telegram - 🔥лучшие ит-каналы

@ai_machinelearning_big_data - Machine learning

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

РКН: https://vk.cc/cIi9vo

#VRHSZ
Download Telegram
Forwarded from Machinelearning
🌟 Turbovec: библиотека векторного поиска на основе гугловского TurboQuant

Библиотека написана на Rust, есть привязки для Python, а в основе - TurboQuant, алгоритм сжатия векторов, который Google описали в статье, принятой на ICLR 2026.

Сама библиотека к Google отношения не имеет, это независимая реализация чужого алгоритма.


🟡Turbovec сжимает данные примерно в восемь раз

Коллекция из 10 миллионов документов, занимающая в исходном виде 31 гигабайт, умещается в 4. Поиск при этом, как утверждает автор, идёт быстрее, чем в FAISS - одного из самых распространённых инструментов в этой области.

По замерам turbovec обгоняет FAISS в среднем в 3,4-3,5 раза при 4-битном сжатии и на 20-26% при 2-битном, в зависимости от железа.

🟡Удобные мелочи

Индекс не нужно предварительно обучать - векторы просто добавляются по мере поступления.

Сохранение инкрементальное, на диск уходит только то, что изменилось с прошлого раза, поэтому даже на большом индексе это занимает миллисекунды.

Поиску можно передать список разрешённых документов - скажем, чтобы пользователь видел только свои файлы.

Удаление работает по постоянным идентификаторам, ссылки на записи не плывут.

Тем, кто уже сидит на LangChain, LlamaIndex, Haystack или Agno, автор предлагает готовые адаптеры - меняется одна строка импорта, остальной код остаётся как был.


📌Лицензирование: MIT License


🖥 Github


@ai_machinelearning_big_data

#AI #ML #VectorSearch #TurboQuant #Rust
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1🔥1