Признаки, эмбеддинги и теги
Для кого: Для тех, кто сравнивает вкладки поиска и панели метаданных. Задача: Объяснить каждый источник данных и подходящие способы его применения. Тип: Понятие
Интерфейс показывает несколько видов информации. Все они хранятся в SQLite, но поступают из разных источников и помогают принимать разные решения.
Начните с вопроса
| Вопрос | Полезные данные | Что появляется в приложении |
|---|---|---|
| Что файл уже сообщает о себе? | Файловые теги | Исполнитель, название, альбом, жанр, BPM, тональность и другие метаданные с поиском |
| Какие треки находятся в одном обученном аудиоокружении? | MERT | Ранжирование поиска по референсным трекам (seed) |
| Какие треки близки по ритму, звучанию, динамике, гармонии или темпу? | SONARA | Поиск по признакам и данные о переходах |
| Какие треки подходят текстовому описанию звука? | CLAP | Результаты текстового поиска |
| Какие жанроподобные и звуковые данные добавляет другая модель? | MAEST | Видимые метки и поддержка SET и Hybrid |
| Как ещё одна модель ранжирует этот референсный трек? | MuQ | Отдельная колонка LAB Reference Compare |
| Насколько трек соответствует моей размеченной идее? | Оценка классификатора | Фильтры CLASS и необязательные настройки SET или Hybrid |
Эмбеддинг — компактное представление аудио, созданное моделью для сравнения. Отдельные числа внутри него интерпретировать не нужно. Признаки имеют понятные названия и часто объясняют, какое слышимое свойство повлияло на результат. Файловые теги — это метаданные, прочитанные из файла или записанные через явно запущенный сценарий записи тегов.
Файловые теги
Scan и Refresh Tags используют Mutagen для чтения фиксированного набора: исполнитель, название, альбом, жанр, год, страна, лейбл, номер в каталоге, номер трека и диска, BPM, тональность, комментарий, ISRC, длительность, аудиоформат и сведения о кодеке, если они доступны.
Это теги исходного файла. Они могут быть неполными или непоследовательными. Приложение сохраняет в SQLite копию, безопасную для JSON.
Признаки SONARA
SONARA создаёт понятные аудиопризнаки и производные рабочие поля: BPM, тональность, длительность и энергию. Они поддерживают вкладку SONARA и помогают Smart Set Builder рассуждать о ритме, динамике, тембре, тональном содержимом, движении энергии и совместимости перехода.
Более новые результаты SONARA добавляют необязательные поля: тональность Camelot, vocalness, mood, громкость, сетку долей, структуру и тишину. Относитесь к этим оценкам как к данным анализа, доступным для проверки. На ранжирование влияют только поля, подключённые к конкретному расчёту оценок.
Степени соответствия настроениям показываются и сохраняются для возможных будущих сценариев. Сейчас они не используются при расчёте сходства, в SET, Hybrid или классификаторах. True peak и ReplayGain также сохраняются для возможных функций управления громкостью, а не для прямого расчёта сходства SONARA. Скалярные значения громкости могут входить в вариант классификатора sonara2. Текущее сравнение динамики SONARA использует максимум моментальной громкости и диапазон громкости. Vocalness доступен через явный модификатор поиска и необязательный вариант sonara2vocal.
Полные позиции долей и атак, метки и события аккордов, кривые темпа, энергии и громкости, структурные сегменты и массивы первых долей такта находятся в Artifacts sonara_timeline. Эмбеддинг и отпечаток SONARA используют отдельные таблицы Artifacts. Векторы MAEST, MERT, MuQ и CLAP также находятся в отдельных таблицах обязательной базы Artifacts. Компактные скалярные и фиксированные векторные значения SONARA остаются в Core.
Значения SONARA — результаты анализа, а не копии файловых тегов. Сценарии, учитывающие темп, сначала используют актуальные данные SONARA с действующей подписью. При уверенности ниже 0.45 они также проверяют ранжированные варианты темпа и тег BPM из Mutagen. Стабильность сетки долей может снизить надёжность; ненадёжный сигнал сдвигает результат к нейтральной оценке, а не создаёт сходство.
SONARA v0.2.9 core хранит bpm_confidence рядом с исходным BPM, кандидатами темпа и тональностью Camelot. Реестр контрактов сохраняет схему 4, идентичность пакета и сборки, запрошенные признаки и другие параметры как канонический JSON с хешами. Сырые сведения анализатора проверяются, но их полное обратное сохранение не обещается.
CLI и API по умолчанию выбирают core. timeline, embedding и fingerprint — независимые результаты. Детерминированный контракт позволяет поставить отсутствующий актуальный результат в очередь, не делая core недействительным. Клиент React ещё не перенесён на структуры v7.
Точные границы полей и расчётов см. в контракте SONARA v0.2.9.
Метки и эмбеддинг MAEST
MAEST сохраняет жанроподобные метки и аудиоэмбеддинг. Метки используются для отображения и необязательной записи стандартного тега жанра. Эмбеддинг может служить аудиосигналом в SET и предварительном просмотре Hybrid.
Smart Set Builder может использовать эмбеддинг MAEST, но не превращает жанровые метки MAEST в правила отбора.
Эмбеддинг MERT
MERT сохраняет аудиоэмбеддинг. Вкладка MERT ищет в этом пространстве от выбранных референсных треков. Сохранённые эмбеддинги также применяются в SET, Hybrid и Audio Dedup.
Эмбеддинг MuQ
MuQ сохраняет отдельный аудиоэмбеддинг из аудио float32 с частотой 24 кГц. Это самостоятельное семейство анализа, которое можно сбрасывать независимо. LAB Reference Compare показывает соседей MuQ для одного референсного трека. MuQ не используется в поиске MERT/SONARA, SET, Hybrid, Audio Dedup или при расчёте оценок классификаторов.
Аудиоэмбеддинг CLAP
Анализ CLAP сохраняет аудиоэмбеддинги. Во время поиска вкладка CLAP преобразует текстовый запрос и сравнивает его с этими векторами. SET, Hybrid и Audio Dedup используют те же аудиоэмбеддинги как сигнал аудио–аудио, который отличается от оценки текстового запроса CLAP.
Оценки классификаторов
Опубликованные классификаторы Rhythm Lab записывают оценки с ключом classifier_key. Они необязательны. Отсутствующие оценки остаются нейтральными в модификаторах SET и Hybrid.
Почему источники нужно разделять
Жанровый тег файла, жанровая метка MAEST, оценка текстового поиска CLAP и сходство содержимого Audio Dedup отвечают на разные вопросы. Используйте их вместе, но не считайте одной общей шкалой.