Дослідники розробили метод перекладу текстових ембедингів між моделями без спарованих даних
Harnessing the Universal Geometry of Embeddings

Науковці представили перший неконтрольований метод перекладу текстових ембедингів з одного векторного простору в інший без парних даних, енкодерів чи наперед відомих відповідників — спираючись на гіпотезу «платонічного представлення» універсальної семантичної структури. За їхніми даними, метод дає високу косинусну подібність між моделями різної архітектури, розміру та навчальних даних. Автори застерігають, що це створює серйозну загрозу безпеці векторних баз даних: зловмисник, маючи доступ лише до векторів ембедингів, може відновити чутливу інформацію про вихідні документи, достатню для класифікації та встановлення атрибутів.
Мовою оригіналу · EN
Researchers introduce the first unsupervised method for translating text embeddings between vector spaces without paired data, encoders, or predefined matches, leveraging a conjectured universal…
Читати оригінал на Hacker News (100+ балів) →
Чому в стрічці: AI-дослідження з Hacker News про безпекові ризики ембедингів — збігається з інтересом до AI-ризиків і джерела HN.