Введение в технологии Big Data.dor_БАК_24-109-Б_ДДО по рн

Введение в технологии Big Data.dor_БАК_24-109-Б_ДДО по рн — вариант 9

Просмотрите все вопросы и варианты бесплатно. Правильные ответы скрыты и открываются только после получения доступа.

10 вопросов Вариант 9 Доступ 7 дней
Содержание теста

Вопросы и варианты

Без отметок и подсказок к правильным ответам

Вопрос 1

Процесс приведения слова к его базовой форме, с учетом его семантических характеристик – это …

  1. стандартизация
  2. лемматизация
  3. деанонимизация
  4. спряжение
Вопрос 2

… информация – это данные, не имеющие заранее определенной структуры или формата, включая тексты, изображения, аудио и видео

  1. неструктурированная
Вопрос 3

… – это слова, которые очень часто встречаются в тексте, но не несут значимой семантической нагрузки для анализа текста (например, предлоги, союзы, местоимения); исключение этих слов из анализа помогает сосредоточить внимание на более значимых словах и уменьшить объем данных для обработки

  1. Стоп-слова
Вопрос 4

… группы содержат слова, объединенные общим смыслом или темой

  1. Семантические
Вопрос 5

Установите соответствие терминов и их значений:

  1. Токенизация
  2. Деанонимизация
  3. Стемминг
  4. разделение текста на слова; является фундаментальным этапом в обработке естественного языка
  5. процесс установления личности автора анонимного текста
  6. процесс сведения слов к их основной (корневой) форме путем удаления окончаний и суффиксов
Вопрос 6

Установите элементы применения лемматизации в анализе текстов и их характеристики:

  1. Поиск по ключевым словам
  2. Классификация текста и кластеризация
  3. Извлечение информации
  4. улучшает точность и полноту поиска, позволяя находить документы, содержащие разные формы слова
  5. помогает группировать тексты по смыслу, уменьшая влияние грамматических вариаций слов на процесс классификации
  6. облегчает процесс извлечения специфических данных из текста, таких как имена, даты, местоположения, уменьшая количество вариаций каждого извлекаемого элемента
Вопрос 7

Расстояние … – это мера различия между двумя строками одинаковой длины, определяемая количеством позиций, на которых соответствующие символы этих строк различны

  1. Хэмминга
  2. Левенштейна
  3. Махаланобиса
Вопрос 8

Расстояние… – это метрика, измеряющая разницу между двумя строками текста как минимальное количество односимвольных изменений (вставки, удаления, замены), необходимых для преобразования одной строки в другую

  1. Левенштейна
Вопрос 9

Идентификация авторства текста – это определение автора текста на основе …

  1. анализа его стиля письма и других уникальных характеристик текста
  2. электронной подписи автора
  3. договора, заключенного с издательством
  4. факта первой публикации текста, принадлежащей данному автору
Вопрос 10

Говоря о кластеризации, можно утверждать, что она … (укажите 2 варианта ответа)

  1. представляет собой процесс установления личности автора анонимного текста
  2. представляет собой процесс группировки слов или предложений таким на основе их семантической близости или других схожих характеристик
  3. значительно упрощает анализ текста, позволяя системам обработки естественного языка (NLP) лучше понимать контекст и смысл текстов
  4. помогает свести слова к их основной (корневой) форме путем удаления окончаний и суффиксов