Как работает поиск
Два механизма поиска — лексический на точные совпадения и семантический для расширенного, — и как понять, каким из них найдена позиция.
Поиск идёт по двум полям формы, независимым друг от друга:
- Код ТН ВЭД — числовой поиск по базе кодов;
- Описание товара — текстовый поиск по формулировкам контрольных списков.
Заполнить достаточно одно из них. Заполнив оба, вы получите и совпадения по коду, и близкие по смыслу позиции, отсортированные по релевантности.
Поиск по коду ТН ВЭД
Код проверяется одновременно по НКС и Единому перечню.
| Что введено | Что найдёт |
|---|---|
Полные 10 цифр — 8421197009 | Точное совпадение позиции. |
4–9 цифр — 842119 | Все позиции, чей код начинается с этого префикса. |
Совпавшая часть кода в карточке результата подсвечивается зелёным, остальные цифры — серым. По коду в карточке можно кликнуть — он подставится в форму поиска.
Короткий префикс даёт больше результатов, а не меньше. Если по 10 цифрам ничего не нашлось, отбросьте последние 2–4 цифры и повторите — ограничение часто установлено на уровень товарной позиции, а не конкретной подсубпозиции.
Лексический поиск: точные совпадения
Первый механизм ищет слова запроса в тексте позиций. Это полнотекстовый поиск с учётом русской морфологии плюс нечёткое сравнение по символам — так «бинокли» находят «бинокль», а опечатка в одну букву не рушит запрос.
Ключевые свойства:
- Учёт формы слова. «Центрифуги» и «центрифуга» — одно слово.
- Границы слов. «дрон» не совпадёт внутри «гудрон»: слово должно начинаться с искомой основы, а не просто содержать её.
- Вес редких слов. Редкое слово в запросе значит больше частого: в «оборудование для обогащения урана» решающими будут «обогащение» и «уран», а не «оборудование», которое встречается в сотнях позиций.
- Словарь синонимов. Небольшой набор отраслевых замен подставляется автоматически.
Такая позиция помечается бейджем «по словам: …» с перечислением того, что именно совпало.
Семантический поиск: расширенный
Второй механизм сравнивает смысл описания с каждой позицией контрольных
списков. Текст переводится в вектор (модель bge-m3), и близость измеряется
косинусным расстоянием — совпадение слов при этом не требуется вовсе.
Так находится то, что лексика пропускает:
| Запрос | Найденная позиция | Почему сработало |
|---|---|---|
фреон | «Озоноразрушающие вещества», бромхлордифторметан | Бытовое название и химическое наименование — об одном веществе. |
хладагент R-22 | категория 1.1 Единого перечня | В тексте позиции нет ни «хладагента», ни «R-22» — совпадает смысл. |
квадрокоптер | «Беспилотные летательные аппараты» | Разговорный термин против формулировки документа. |
прибор ночного видения | позиции двойного назначения для ВВТ | Описание из инвойса против отраслевой терминологии списка. |
Позиция, найденная только семантикой (слов запроса в ней нет), помечается серым бейджем «возможно связано» и процентом близости. Это гипотеза, которую стоит проверить по источнику, а не готовый вывод.
Как эти два механизма сочетаются
Лексика отбирает кандидатов, семантика уточняет их порядок. Итоговая оценка — взвешенная сумма: 70 % лексического совпадения и 30 % семантического.
Если по словам запроса не нашлось ничего, включается семантический фолбэк — выдача целиком строится на смысловой близости, и все её позиции получают бейдж «возможно связано».
Порядок в списке всегда один и тот же:
Сначала совпадения по словам
Позиции с бейджем «по словам» стоят выше «возможно связано» — независимо от процентов.
Затем по итоговой оценке
Внутри группы — по убыванию релевантности.
Затем по длине совпадения кода
При равной оценке выше та позиция, у которой с введённым кодом совпало больше цифр.
Формулировка запроса
- Берите описание из инвойса как есть — это и есть тот текст, для которого система настроена.
- Убирайте служебное. Артикулы, модели и количество не помогают: «HP-2200, 4 шт.» — шум, «промышленная центрифуга» — сигнал.
- Добавляйте назначение. «Насос» найдёт слишком много; «насос для перекачки агрессивных сред» сузит выдачу до нужного.
- Пробуйте синонимы. Если ничего не нашлось, попробуйте бытовое название вместо технического — и наоборот.
- Комбинируйте с кодом. Код отсекает ложные срабатывания, описание — ранжирует то, что осталось.