Сегодня вторник, 25.08.2026, 19:21, ньюсмейкеров: 45151, сайтов: 1203, публикаций: 3604107, просмотров за сутки: 249244
25.08.2005 00:00
Новости.
Просмотров всего: 4415; сегодня: 2.

Поиск информации. Взгляд со стороны пользователя

Каждый из нас не один раз в своей жизни сталкивался с проблемой поиска информации. Не важно, какой источник данных мы используем: интернет, файлы на диске, база данных или глобальная информационная система какой-либо крупной компании. Проблем может быть множество: это и физический объем «базы» в которой осуществляется поиск, и неструктурированность информации, и различные типы файлов, в которых эта информация содержится и даже сложность формулировки поискового запроса. Уже сейчас объемы информации, к примеру, на отдельно взятом персональном компьютере можно сравнить с объемами текстов приличной библиотеки. А потоки неструктурированных знаний в будущем будут только возрастать, притом гигантскими темпами. Если для обычных пользователей это еще пол беды, то для крупных компаний отсутствие контроля за информацией может означать большие проблемы. Таким образом, давно возникла потребность в создании систем и технологий поиска, облегчающих и ускоряющих доступ к нужной нам информации. Таких систем множество, да и не каждая система – это уникальная технология. И какую технологию именно выбрать – напрямую зависит от тех задач, которые предстоит решать. Спрос на совершенные инструменты поиска и обработки информации все более возрастает. Что же обстоит с предложением?
Не вдаваясь в различные изюминки технологий, программы и системы поиска можно поделить на три группы. Это глобальные поисковые интернет-системы, готовые решения для бизнеса (корпоративные технологии поиска и обработки информации) и простой файловый или фразовый поиск на локальном компьютере. Различные направления – по идее различное исполнение.
Локальный поиск. С файловым поиском на отдельно взятом персональном компьютере все просто. Он не отличается особыми возможностями и какими-либо изысками, разве что выбором типа файла (медиа, текст и так далее и места поиска). Вводим имя искомого файла (или часть текста, например, документа Word) и вперед. Скорость поиска и результат напрямую зависят от того, что мы вводим в строке запроса. Интеллектуальности тут по нулям – обычный перебор наличествующих файлов на предмет соответствия. Что, в общем-то, и оправдано – зачем создавать навороченную систему для столь нехитрых нужд?
Технологии глобального поиска. Совсем иначе дело обстоит с поисковыми системами, работающими в глобальной сети. Тут уже не до перебора. Гигантские объемы (тот же Яндекс может похвастаться индексацией более чем 11 терабайт данных), специфика организации и структуризации информации и глобальная хаотичность сделают простой поиск не только неэффективным, но и долгим и трудоемким. Поэтому в последнее время так продвинулись вперед разработки именно по оптимизации и улучшению поиска. Но пока схема все еще остается довольно простой (за исключением секретных нововведений каждой отдельно взятой системы) – фразовый поиск в проиндексированной базе документов с учетом морфологии и синонимов. Само собой, такой подход работает, хотя проблемы до конца не решает. Читая десятки страниц из различных статей, посвященных улучшению поиска с помощью того же Google или Yandex, можно прийти к выводу, что без знания скрытых возможностей данных систем найти нужный документ по запросу – дело не одной минуты, а иногда и не одного часа. Проблема в том, что такая реализация «поиска» очень зависима от фразы или слова «запроса», вводимого пользователем. Чем запрос расплывчатей, тем поиск хуже. Это уже аксиома. Или догма – как угодно. Конечно, при знании и толковом использовании ключевых функций поисковиков и правильном подборе фразы, по которой ищутся документы или сайты можно добиться вполне неплохих результатов. Но это плод кропотливого умственного труда пользователя и времени, затраченного на просмотр ненужной информации, но все же содержащей «наводки» хотя бы для «апгрейда» запроса. В общем, вводим фразу, просматриваем несколько результатов, убеждаемся, что искали не так, вводим новую фразу и так до того момента, пока соответствие не становится максимальным. Но и тогда шансы найти нужный документ все еще остаются довольно низкими. Заморачиваться с «расширенным поиском» (а он представлен, в принципе, неплохим набором функций – выбор языка, формата файла и так далее) обычный пользователь не будет. Хотелось бы просто ввести слово/фразу и получить ответ. А как он будет получен – не важно. Пусть лошадь думает – у нее голова большая. Может быть, это и не к месту, но одна из функций Гугля - «Мне повезет» очень хорошо характеризует поиск с помощью существующих технологий. Но все-таки она вертится. То есть, технология работает. Пусть не идеально и не всегда как нам хочется, но если сделать скидку на сложность поиска в хаосе интернет и на объем данных, то даже приемлемо.
Корпоративные системы. Третьей в списке значатся готовые решения на базе поисковых технологий. Они предназначены для серьезных компаний и корпораций, обладающих действительно гигантскими базами данных и под завязку набитыми различными документами информационными системами. В принципе, технологии сами по себе могут использоваться и для «домашних» нужд. Например, работающий вне офиса программист найдет применение технологии поиска для разбросанных по всему жесткому диску своего компьютера исходникам различных программ. Но это частности. Основное применение данные технологии находят все же в тех случаях, когда требуется осуществлять быстрый и точный поиск в больших массивах данных и для работы с различными источниками информации. Схема работы таких поисковых систем довольно проста (хотя за ней кроется, конечно, множество уникальных методов индексации информации и обработки запроса): поиск по фразе. С учетом всех словоформ, синонимов и прочая. Что опять же приводит нас к проблеме человеческого ресурса: при использовании такой технологии (а это, для примера, линейка программ «Hummingbird» или «Verity») пользователю надо сначала составить для себя ориентировочные фразы, которые будут являться критерием поиска, и будут, по идее, встречаться в нужных документах. Но, далеко не факт, что пользователь самостоятельно сможет подобрать или вспомнить нужную фразу и опять же нет особой уверенности, что последующий поиск будет удовлетворительным.
Еще одним ключевым моментом является скорость обработки запроса. Конечно, при использовании в качестве фразы для поиска целого документа вместо одного двух слов, точность поиска увеличивается на порядок. Но на сегодняшний день такая возможность просто не использовалась из-за очень большой емкости процесса. Дело в том, что поиск по нескольким словам или небольшой фразе не даст нам точной похожести найденных документов. А поиск по фразе длиной в целый документ в существующих системах занимает слишком много времени и очень требователен к вычислительным ресурсам. Можно привести условный пример. При отработке поискового запроса по одному ключевому слову большой разницы нет, с какой скоростью будет отработан этот запрос: 0,1 секунды или 0,001 секунды, поскольку пользователь разницы и не заметит. Если же взять среднего размера документ, который содержит порядка 2000 уникальных слов, то поиск с учетом морфологии (всех словоформ) и тезаурусов (синонимов), и вывод релевантного списка найденных документов в случае с поиском по ключевым словам займет несколько десятков минут (что неприемлемо для пользователя).
Промежуточное «Итого». Как видим, существующие на сегодняшний день системы и технологии поиска документов хоть и работают (частью даже замечательно), но все же не решают основной проблемы поиска в полной мере. Если устраивает скорость, то качество поиска оставляет желать лучшего. А если поиск точный и адекватный, то это требует уйму времени и вычислительных ресурсов. Можно, конечно, решить данную задачу очевидным способом – повышением вычислительной мощности. Но, ставить в офис систему из нескольких десятков ультра-скоростных компьютеров, которые будут без перерыва обрабатывать фразовые запросы из тысяч уникальных слов, перепахивая десятки гигабайт входящей корреспонденции,

Тематические сайты: PublisherNews - портал системы продвижения публикаций, Агрегатор счастья, Бизнес России, Глобализация, Клуб "Бизнес, информация"

Ньюсмейкер: SearchInform — 142 публикации

Интересно:

От сари до БРИКС: как Россия сближается с Индией
24.08.2026 23:31 Мероприятия
От сари до БРИКС: как Россия сближается с Индией
2026 году отношения России и Индии подошли к важному рубежу: быстрый рост торговли необходимо превратить в более сбалансированное партнёрство. По данным Министерства иностранных дел Индии, двусторонний товарооборот достиг рекордных 68,7 млрд долларов в 2024–2025 финансовом году, однако по итогам 2025–2026 года снизился почти до 59,9 млрд. Следующая общая цель — 100 млрд долларов к 2030 году. Главный вызов — расширить сотрудничество за пределы энергетики: в фармацевтике, технологиях, строительстве, туризме и креативных индустриях. Председательство Индии в БРИКС придаёт этой повестке дополнительный вес. Поэтому Форум БРИКС в рамках фестиваля «День Индии» точно отразил нынешний этап отношений двух стран: от устойчивой дружбы — к новым практическим проектам. Утром 20 августа в Гостином Дворе соседствовало всё: строгие костюмы участников Форума БРИКС, яркие сари, музыка, деловые переговоры, индийская...
24.08.2026 20:49 Интервью, мнения
ГИГАНТ — Комплексные системы: сокращение производства электроники
Российский производитель оборудования «ГИГАНТ — Комплексные системы» прокомментировал данные АРПЭ о сокращении российского рынка контрактного производства электроники. По оценке компании, снижение связано не только с падением спроса, но и с избытком производственных мощностей, который сформировался после инвестиционного цикла последних лет. По данным нового исследования Ассоциации разработчиков и производителей электроники, в 2025 году объем российского рынка контрактного производства электроники сократился на 9,4% и составил 30,46 млрд руб. По итогам 2026 года АРПЭ прогнозирует дальнейшее снижение рынка на 18%, до 24,98 млрд руб. Сокращение рынка связано с общим спадом в производстве электроники, снижением инвестиционной активности и уменьшением объемов государственных закупок. Для контрактных производителей это означает падение загрузки производственных линий и усиление конкуренции за заказы. По оценке Станислава Дажина, специалиста...
Почему визитка не работает? Новая формула международного бизнеса.
24.08.2026 19:23 Интервью, мнения
Почему визитка не работает? Новая формула международного бизнеса
20 августа в Москве состоялся День открытых дверей Ассоциации «Русско-Латиноамериканский дом». Для меня как одного из организаторов и модераторов этой встречи было принципиально важно, уйти от привычного формата, когда участники деловой встречи несколько часов слушают доклады, обмениваются визитками и зачастую расходятся, так и не поняв, чем конкретно могут быть полезны друг другу. Я давно наблюдаю одну и ту же ситуацию. Вокруг нас огромное количество сильных предпринимателей и экспертов. Один умеет выводить компании на зарубежные рынки, другой занимается международной логистикой, третий — финансами, четвертый — производством, пятый — юридическим сопровождением. Но знаем ли мы возможности друг друга настолько хорошо, чтобы при появлении конкретного запроса сразу понимать, кому его передать? Именно поэтому, когда мы формировали День открытых дверей РУЛАД, мне хотелось построить его вокруг простой идеи: не просто познакомить людей...
21.08.2026 19:20 Интервью, мнения
ГИГАНТ — Компьютерные системы: готовность КИИ к закону об ИИ
Дмитрий Битченков, директор департамента сопровождения конкурентных процедур компании «ГИГАНТ — Компьютерные системы» рассказал, почему более половины ИИ-проектов в КИИ разваливаются из-за некачественных данных, как отсутствие единой стратегии управления информацией порождает системные риски, а также объяснил, чем опасна децентрализация ответственности за ИИ и почему выстраивать AI Governance нужно уже сейчас, не дожидаясь подзаконных актов. Почему качество данных становится главным барьером для выполнения требований нового закона и почему более 50% ИИ-проектов закрываются именно из-за этой проблемы? ИИ-модель не исправляет проблемы в исходных данных, а масштабирует их. Если сведения неполные, дублируются, хранятся в несопоставимых форматах или противоречат друг другу, модель начинает выдавать недостоверные результаты. При этом компания не может уверенно объяснить, на основании каких данных был получен конкретный вывод, воспроизвести...
Как меняется анатомия по мере обучения в медвузе
21.08.2026 15:16 Консультации
Как меняется анатомия по мере обучения в медвузе
На первом курсе студент разбирает кости, мышцы, сосуды и внутренние органы как отдельные части одной большой системы. Через несколько лет от него уже требуется совсем другое знание – понимать, что находится рядом с конкретным нервом, через какие ткани проходит хирургический доступ и почему повреждение структуры в одной зоне может изменить работу другой. Поэтому курсы анатомии для студентов могут решать разные задачи в зависимости от этапа обучения и будущей специальности. Анатомия не остается одинаковой на протяжении всего медицинского образования. Сначала студент учится узнавать и называть структуры, затем – видеть их взаимное расположение, а позже – использовать эти знания при изучении клинических дисциплин. То, что на раннем этапе кажется набором терминов, постепенно становится языком, на котором описывают обследование пациента, операцию, результат компьютерной томографии или повреждение нерва. Нормальная анатомия создает...