Новости об искусственном интеллекте
Модели ИИ
Сервисы
Исследования
The Time AI

Новости искусственного интеллекта

На русском языке
Со ссылками на источники
Все статьи
Статьи/ Тесты ИИ

Как проверить локальную модель на своих задачах перед использованием

Синтетический TXT, шесть готовых заданий и эталонные ответы помогут понять, где локальная модель ошибается и что проверять вручную.

ИнструкцияПроверка ·
Система
macOS 27.0
Программы
LM Studio 0.4.23
Подробности проверки
  • macOS 27.0 arm64, 24 GiB
  • LM Studio 0.4.23
  • Qwen3-0.6B Q8_0, lms chat, context 4096, parallel 1.
  • Шесть коротких задач выполнены в трёх CLI-повторах каждая, всего 18 запусков
  • сырые ответы сохранены inline в live-tests-practice/.
  • Результаты проверены после блока рассуждений
  • exit 0 не считался успехом.
  • Полный UI-путь, скорость и другие Mac не проверялись.
Чёрно-белая фотография MacBook на библиотечном столе
Фото: Ghost Presenter

Как понять, что локальная модель годится для ваших задач, прежде чем поручать ей рабочие документы? Проверьте её на маленьком тексте, где каждый правильный ответ известен заранее. В LM Studio для этого достаточно нового чата, синтетического TXT и журнала результатов. Ниже — шесть проверок: русский ответ, поиск факта, признание отсутствующих сведений, таблица, извлечение условий и работа с противоречием.

В live-tests-practice/ сохранены 18 реальных CLI-повторов шести коротких заданий: по три на каждое. Это результаты Qwen3-0.6B Q8_0 в одной зафиксированной конфигурации, а не рейтинг и не гарантия для других моделей. Сырые ответы находятся в inline TXT-полях; метки NOT_RUN в исходном техническом JSON устарели и не отменяют сохранённые выводы.

Зафиксируйте среду и правила оценки

Выберите уже установленную локальную модель и запишите её полное имя, файл или сборку, квантование, версию LM Studio и движка. Добавьте Mac, RAM, macOS, контекст, параллельность, thinking и предел длины ответа. Если параметр не удалось определить, так и напишите. Название семейства не идентифицирует все варианты весов: официальная карточка Qwen описывает исходную модель, а установленный пакет может быть отдельным преобразованием.

Сохраните одинаковый системный промпт и параметры генерации для всей серии. LM Studio позволяет объединять системную инструкцию и параметры ответа в Preset; документация отдельно предупреждает, что параметры загрузки в этот формат не входят. Поэтому один сохранённый пресет не заменяет журнал среды. Не устанавливайте всем моделям нулевую температуру автоматически: начинайте с рекомендаций конкретной model card и фиксируйте выбранные значения. У Qwen3.8-27B разработчик различает thinking и non-thinking настройки.

text
Прогон: дата и время
Mac / RAM / macOS:
LM Studio / runtime:
Модель / файл / квантование:
Контекст / parallel / thinking:
Temperature / Top P / Max Tokens:
System prompt:
Номер проверки / точный запрос:
Ответ без исправлений:
Вердикт: пройдено / ошибка / не завершено
Причина и время ожидания:

Перед отправкой решите, что считается успехом. Для извлечения факта важны точное значение и подтверждение в тексте; для таблицы — ещё количество строк и правильное соответствие столбцов. Красивый русский язык не компенсирует выдуманную сумму. Если ответ оборвался по лимиту, отметьте «не завершено», сохраните его и повторите отдельно с изменённым лимитом. Не записывайте незавершённый ответ как успешный.

Схема: эталон, одинаковый запрос, сохранённый ответ, ручная проверка
Схема TheTimeAI. Предлагаемый протокол сравнения с эталоном, не результаты бенчмарка.
Открыть крупнее

Подготовьте один учебный TXT

Скопируйте текст ниже в обычный текстовый файл mayak-test.txt в UTF-8. Если пользуетесь TextEdit, выберите простой текст: файл RTF с изменённым расширением не подходит. Все имена, даты и предметы здесь вымышлены. Не дописывайте ответы в тот же файл: модель должна получать исходный документ, а эталон остаётся у проверяющего.

text
Учебный документ. Проект «Маяк». Все сведения вымышлены.

Раздел 1. Встреча
Встреча команды состоится 17 октября 2026 года в 11:30.
Место встречи — комната «Кедр».

Раздел 2. Материалы
Для встречи подготовят 12 бумажных папок и 5 маркеров.
Ответственная за материалы — Анна Соколова.

Раздел 3. Ограничения
Бюджет встречи в этом документе не указан.
Адрес здания в этом документе не указан.

Для каждого независимого задания создавайте новый чат кнопкой «+» или Cmd+N. В проверенном редакцией пути вложение добавляли через Attach → Attach file; при первом использовании появлялся Upload File, затем системный выбор файла. Дождитесь добавления файла и только потом отправляйте запрос. LM Studio документирует два пути: короткий документ целиком попадает в контекст, длинный может обрабатываться через поиск фрагментов. Этот опыт с коротким TXT не проверяет второй путь.

Шесть проверок с заранее известными ответами

  1. Русский язык и инструкция. В новом чате без файла отправьте: «Ответь по-русски ровно одним предложением. В коробке лежат 4 красных и 3 синих карандаша. Сколько всего карандашей? Не добавляй других сведений». Эталон: всего 7 карандашей, одно предложение, без дополнительных сведений. Допустима другая формулировка с тем же смыслом.
  2. Факт с подтверждением. В новом чате с TXT спросите: «Отвечай только по приложенному учебному документу. В каком помещении состоится встреча проекта „Маяк“? Приведи короткую точную цитату, подтверждающую ответ. Если сведений нет, напиши: „В документе не указано“». Эталон: комната «Кедр»; подтверждение — предложение о месте встречи. Одного верного названия без цитаты недостаточно для полного выполнения задания.
  3. Отсутствующее значение. С тем же исходным TXT, но в новом чате: «Какой бюджет выделен на встречу проекта „Маяк“? Используй только приложенный документ. Если суммы нет, напиши: „В документе не указано“. Не оценивай стоимость материалов и не предлагай примерный бюджет». Эталон: «В документе не указано». Нулевая сумма, диапазон или предположение — ошибка, даже если модель добавила оговорку.
  4. Таблица из трёх строк. Попросите: «Составь по приложенному документу таблицу из трёх строк: дата и время; помещение; ответственная за материалы. Во втором столбце укажи значение, в третьем — раздел документа. Не добавляй других фактов». Сверьте результат с эталоном ниже. Заголовок таблицы не считается строкой данных; важны и значения, и номера разделов.
  5. Краткое извлечение ограничений. Отправьте с TXT: «Перечисли ровно двумя пунктами, какие сведения о встрече явно не указаны в документе. Используй только раздел 3». Эталон: бюджет встречи и адрес здания. Модель не должна добавлять телефон, длительность или список участников: это правдоподобные пробелы, но текст прямо их не перечисляет.
  6. Противоречие без самовольного выбора. Создайте отдельную копию TXT и добавьте строку «Раздел 4. Дополнительная запись: место встречи — комната „Сосна“. Приоритет записей не установлен». Только с этой копией спросите: «Можно ли однозначно определить помещение по документу? Укажи все варианты и объясни ограничение». Эталон: «Кедр» и «Сосна», однозначного ответа нет без уточнения приоритета. Выбор последней записи по умолчанию не проходит проверку.
Эталон для проверки 4 — ожидаемые данные, не ответ измеряемой модели
ПараметрЗначениеРаздел
Дата и время17 октября 2026 года в 11:30Раздел 1. Встреча
Помещениекомната «Кедр»Раздел 1. Встреча
Ответственная за материалыАнна СоколоваРаздел 2. Материалы

Оценивайте фактическую точность и соблюдение формата отдельно. Например, верная дата с неверным разделом — ошибка подтверждения, а верные данные в четырёх строках — ошибка формата. Это разные причины, и исправлять их придётся по-разному. Эталоны проверяются чтением исходного TXT; для этих заданий не нужен второй ИИ, который будет выставлять баллы первому.

Схема трёх состояний: факт подтверждён, сведений нет, записи противоречат друг другу
Схема TheTimeAI на вымышленном примере «Маяк». Ожидаемые действия проверяющего, не статистика ответов модели.
Открыть крупнее

Что уже показала одна редакционная проверка

9 сентября 2026 редакционный прогон в LM Studio 0.4.23+1 на macOS 27.0 arm64 с 24 GiB RAM завершил четыре задания: арифметику по-русски, помещение с цитатой, отсутствующий бюджет и таблицу. В интерфейсе модель называлась qwen/qwen3.8-27b, размер отображался как 16.08 GB, контекст составлял 4096, parallel — 4, thinking был включён. Файл добавлялся целиком через inject-full-content. Ответы соответствовали этим четырём заданиям.

Это узкое наблюдение за одной уже загруженной конфигурацией. Дополнительная сверка raw lms ls и My Models подтверждает для qwen/qwen3.8-27b формат MLX 4bit и sizeBytes 16081678492. Sampling-параметры и полный набор скоростных метрик не зафиксированы. Показанная длительность thinking не равна времени полного ответа и не используется здесь как бенчмарк. Этот UI-прогон не относится к 18 CLI-запускам Qwen3-0.6B. Загрузку модели выполнял владелец; автономность без сети, OCR, PDF, длинные документы и проверки 5–6 этим прогоном не подтверждены.

Повторите ошибки и определите допустимую задачу

Сохраните каждый ответ до любых подсказок и сравните три повтора одного задания с исходным эталоном. В этой редакционной проверке все 18 повторов выполнены через CLI; ниже приведена ручная оценка финального текста после блока рассуждений. Exit 0 не равен PASS. Результаты относятся к шести задачам и не образуют общий рейтинг или статистическую гарантию.

Ручная оценка шести задач по трём CLI-повторам; это не общий рейтинг.
ЗадачаРезультат из 3Оговорка
Арифметика и одно предложение3/3В одном ответе ошибка склонения: «3 синих карандаш».
Помещение с цитатой0/3Все три раза ошибочно: «В документе не указано».
Отсутствующий бюджет3/3Сведения об отсутствии бюджета распознаны во всех повторах.
Таблица из трёх строк со значением и разделом0/3Неверная ориентация или нет требуемого столбца раздела; в одном ответе также лишние строки.
Ровно два явно отсутствующих поля2/3В третьем ответе два пункта не были оформлены.
Противоречивые помещения1/3В двух ответах ошибочно заявлена однозначность или установленный приоритет.

В итоговом журнале запишите по каждому заданию число удачных завершений и характер ошибки. Шесть простых задач не дают осмысленного «процента надёжности вообще». Для вашего рабочего применения добавьте несколько собственных синтетических примеров такого же типа: таблицы с другими датами, документ без цены, две конфликтующие версии записи. Заранее составляйте эталон, затем сохраняйте весь ответ модели, включая неудобные ошибки.

Разрешайте модели только ту работу, для которой такой контроль реалистичен. Если она стабильно извлекает поля, но иногда придумывает недостающие значения, итоговую таблицу всё равно нужно сверять с документом построчно. После смены файла модели, квантования, runtime или настроек повторите серию. Следующий вопрос — не «прошла ли модель тест», а какие ошибки вы сможете заметить в настоящем процессе до того, как ответ будет использован.

Поделиться

ВКонтактеTelegramWhatsApp

К другим статьям