Исследование / HealthTech

·7 мин чтения

AI используют 71% хелстек-стартапов.Как они доказывают, что их софт действительно хорош?

У 20 из 28 хелстек-стартапов с беларусскими корнями искусственный интеллект — неотъемлемая часть продукта: персонализирует тренировки, анализирует питание, распознает новообразования на коже или сердечный ритм. Посмотрели, как компании проверяют свои технологии — от точности алгоритмов и изменений у пользователей до клинических исследований и медицинской сертификации.

Пять типов публичных сигналов проверки HealthTech-продуктов

Клинические исследования

Проверка технологии

Оценка изменений у пользователей

Академические упоминания

Регулирование
/ сертификация

20 / 28
Используют AI как часть продукта
12 / 28
Есть публичный научный, клинический или регуляторный след
16 / 28
Публичных сигналов не обнаружено
Содержание
  1. 00Об исследовании
  2. 01Проверка технологии
  3. 02Оценка изменений у пользователей
  4. 03Клиническая проверка
  5. 04Академический след
  6. 05Регулирование, ISO, патенты
  7. 06Комментарий эксперта

00Об исследовании

Это второй текст на основе HealthTech in Motion — исследования о международных хелстек-стартапах, основанных беларусами. В первой части мы разбирались, кто сегодня создает проекты в сфере здоровья, почему три четверти компаний запускают уже опытные основатели. Сегодня поговорим о том, что стоит за их технологиями. Согласно ресерчу, у 16 из 28 компаний (57%) публичных научных, клинических или регуляторных сигналов не обнаружено (но это не означает, что технологии не тестируются или не работают). У оставшихся 12 публичный след есть и выглядит по-разному.

Публичный след · 28 компаний
Есть публичный научный, клинический или регуляторный сигнал
12
Публичных сигналов не обнаружено
16

Отсутствие публичного сигнала не означает, что технология не тестируется или не работает.

01Проверка технологии

Когда проверяют саму технологию

Например, Skinive, AI-сервис для распознавания проблем с кожей, тестировал точность алгоритма распознавания патологий. В опубликованной работе компания сравнила две версии, обученные на 64 тыс. и 115 тыс. изображений. Для злокачественных новообразований чувствительность более свежей версии достигала 95,4%.

HeartScan, приложение для мониторинга работы сердца с помощью смартфона, проверял, как алгоритм распознает события сердечного цикла. Для этого использовали 7 700+ часов записей акселерометра в условиях шума, движения, собранных с разных моделей смартфона. Лучшая версия алгоритма обнаруживала момент открытия аортального клапана с точностью 99,8%. Пока работа опубликована как препринт.

Doctorina, AI-сервис для медицинских консультаций, пошел другим путем: команда сравнила диагностические результаты своего алгоритма с результатами врачей и других AI-моделей. Для этого использовали 150 смоделированных консультаций первичной помощи. Диагноз Doctorina совпал с референсными в 82% случаев против 57% у врачей. Кроме того, алгоритм стартапа показал самую высокую точность диагностики по сравнению с frontier-моделями (Claude Opus 5, GPT-5.6, Gemini 3.1 Pro, Kimi K3). Это исследование также пока опубликовано как препринт.

Проверка алгоритмов

Skinive

95,4%

Чувствительность к злокачественным новообразованиям у более свежей версии модели. Две версии обучены на 64 тыс. и 115 тыс. изображений.

HeartScan

99,8%

Точность определения момента открытия аортального клапана. 7 700+ часов записей акселерометра. Препринт.

Doctorina

82% vs 57%

Совпадение с референсным диагнозом: Doctorina и врачи. 150 смоделированных консультаций. Препринт.

Здесь измеряют разные показатели на разных данных. Эти проценты нельзя сравнивать как рейтинг продуктов.

02Оценка изменений у пользователей

Когда исследуют не только алгоритм

Flo Health, приложение для женского здоровья, исследует разные аспекты своего продукта. Например, два пилотных рандомизированных исследования с участием более 400 женщин касались роли образовательного контента в вопросах менструального здоровья, ПМС и ПМДР. По окончании исследований, которые длились три месяца, участницы стали лучше разбираться в вопросах женского здоровья, отметили улучшение некоторых показателей. А группа с ПМС и ПМДР — снижение выраженности симптомов. Кроме того, компания проверяла точность своего Symptom Checker на смоделированных случаях эндометриоза, миомы и синдрома поликистозных яичников. В 83–88% случаев выводы компании совпали с оценками независимых врачей. В этом году Flo зарегистрировала исследование функции цифровой контрацепции.

Goodville, мобильная игра, которая использует игровые механики для поддержки ментального здоровья, изучала не алгоритм, а изменения у пользователей. Компания провела 6-недельное исследование более чем 1 700 человек с симптомами депрессии. Около 60% сообщили об уменьшении выраженности симптомов за рассматриваемый период. Но важно отметить: исследование было наблюдательным, без рандомизации и контрольной группы. То есть оно фиксировало изменения у пользователей в моменте, но не доказывало, что именно приложение стало их причиной.

CleverPoint, платформа для оценки психофизиологического состояния на основе EEG/ECG и виртуальный реальности, выступала не объектом, а инструментом исследования. С её помощью у 400+ судовых офицеров и инженеров оценивали реакцию мозга и тела на когнитивную нагрузку. У 73,8% участников обнаружили выраженный стресс, а у участников старше 40 лет — снижение когнитивных функций в условиях стресса. То есть здесь исследовали не точность CleverPoint, а состояние людей с помощью технологии.

За пределами алгоритма

Flo Health

Женщин в двух пилотных рандомизированных исследованиях
400+
Совпадение Symptom Checker с оценками независимых врачей
83–88%

Зарегистрировано исследование цифровой контрацепции

Goodville

~60%

Сообщили об уменьшении симптомов депрессии. Более 1 700 участников, 6 недель. Наблюдательное исследование без рандомизации и контрольной группы.

CleverPoint

73,8%

Участников с выраженным стрессом. 400+ судовых офицеров и инженеров. Платформа была инструментом исследования состояния людей.

03Клиническая проверка

От пилота с 40 детьми до тестирования на 1 000 пациентах

Еще три стартапа, согласно исследованию, находятся на той или иной стадии клинической проверки. Bloom, AI-нутрициолог и трекер питания, говорит в материалах для инвесторов о тестировании клиниками. VR NeuroLink AI, разработчик VR-технологии для нейрореабилитации, сообщает о проверке продукта на 1 000+ пациентах. MindMuscle, нейрофидбек-платформа и EEG-гарнитура для детей с СДВГ, — о пилоте с 40+ детьми и работе с пятью педиатрическими клиниками в США.

Поскольку методология и результаты этих проверок публично недоступны, невозможно определить, что они показали. Поэтому эти кейсы в ресерче учитываются отдельно от опубликованных научных работ.

Заявленная клиническая проверка

Bloom

Клиники

Сообщает о тестировании в материалах для инвесторов.

VR NeuroLink AI

1 000+

Пациентов, по сообщению компании.

MindMuscle

40+

Детей в пилоте. Работа с пятью педиатрическими клиниками в США.

Методология и результаты публично недоступны. Эти кейсы учтены отдельно от опубликованных научных работ.

04Академический след

Когда стартап попадает в поле зрения ученых

Еще несколько стартапов из выборки попали в независимые научные работы. Хотя присутствие в академической литературе не означает однозначную эффективность продукта: в обзоре может быть и полноценный анализ, и простое упоминание в качестве примера.

Например, Skinive минимум дважды попадал в поле зрения независимых исследований: приложение сравнивали с другими AI-сервисами для анализа кожи – по заявленной точности, участию врачей, регуляторному статусу, тому, насколько полно продукт раскрывает информацию пользователям. Stork, приложение для трекинга беременности, также анализировалось в независимом исследовании приложений для самоконтроля во время беременности наравне с другими продуктами.

В то время как Soula приводилась как пример существующего решения, а данные из исследования Zing Coach использовались в рамках академической публикаций, но без оценки эффективности самого приложения.

Разные виды академического следа
Skinive
Сравнение с другими AI-сервисами для анализа кожи
Stork
Анализ в исследовании приложений для самоконтроля во время беременности
Soula
Упоминание как примера существующего решения
Zing Coach
Использование данных исследования без оценки эффективности приложения

Присутствие в научной работе само по себе не подтверждает эффективность продукта.

05Регулирование, ISO, патенты

Другие признаки "зрелости": регулирование, ISO, патенты

Для некоторых хелстек-продуктов исследованиями дело не ограничивается: если стартап намерен использоваться в медицинских целях, ему придется пройти процедуру регуляции как медицинского изделия. В выборке такой трек есть у двух компаний: Skinive — имеет CE-маркировку (медицинское изделие класса I по EU MDR) и VR NeuroLink AI (проходит сертификацию как медицинское изделие класса IIa).

Среди других признаков зрелости компаний: патенты и стандарты менеджмента. Skinive сертифицирован по ISO 13485 – стандарту управления качеством при разработке медицинских изделий. Flo Health имеет сертификаты ISO 27001 и ISO 27701 в области информационной безопасности и приватности данных (и по сообщению компании, является единственным femtech-приложением, сертифицированным по обоим стандартам). MindMuscle получил в США патент на свою EEG-гарнитуру.

Регулирование и другие сигналы зрелости
Skinive
CE · класс I
Медицинское изделие по EU MDR. ISO 13485 — управление качеством при разработке медицинских изделий.
VR NeuroLink AI
Класс IIa · в процессе
Проходит сертификацию медицинского изделия.
Flo Health
ISO 27001 · ISO 27701
Информационная безопасность и приватность данных.
MindMuscle
Патент в США
На EEG-гарнитуру.

06Комментарий эксперта

Когда хороших метрик уже недостаточно

Как видим, единой лестницы доказательности в HealthTech нет. Алгоритм анализа сигналов сердца или медицинское ПО для оценки новообразований на коже решают разные задачи. Соответственно, им требуются разные исследования и разные уровни доказательности. Где проходит эта граница и в какой момент продукту в сфере цифрового здоровья вообще нужна клиническая валидация? Комментирует руководитель технологической компании с многолетним опытом разработки digital health-продуктов для американского рынка, включая проекты для крупных госпиталей и healthcare enterprises. Компания реализовала несколько сотен проектов. Эксперт попросил сохранить анонимность.

Показатель удержания (retention) говорит лишь о том, что люди пользуются продуктом. Но он не доказывает эффективность продукта.
Руководитель технологической компании
Эксперт попросил сохранить анонимность

— В какой момент хелстек-стартапу становится недостаточно того, что продукт просто нравится пользователям и показывает хорошие метрики? Что обычно заставляет компанию переходить к клинической валидации, начинать регуляторный путь?

— Если кратко, то, исходя из нашего опыта, не метрики подталкивают стартап к прохождению клинической валидации. Решающее значение имеют два фактора: желание стартапа заявить о медицинских свойствах продукта и появление плательщика, отличного от самого пользователя (например, клиники, страховой компании или работодателя). Показатель удержания (retention) говорит лишь о том, что люди пользуются продуктом. Но он не доказывает эффективность продукта, а именно это и хочет знать новый покупатель.

— Насколько сильно заявленная функциональность (claims) может менять продукт? Например, один стартап помогает лучше понимать сон, второй — выявлять риск заболевания. Технически они могут использовать похожие AI-модели. Что принципиально меняется во втором случае?

— Заявления — то есть обещания, которые стартап дает пользователям и рынку, — определяют предполагаемое назначение продукта. А именно назначение определяет, считается ли продукт медицинским изделием. Сама модель может быть идентичной, но продукты — разными. В зависимости  от claims меняется все, что окружает модель: цена ошибки, требования к данным, процесс разработки и даже свобода обновления модели.

— Часто стартапы начинают как consumer/wellness/B2C-продукт, а потом хотят работать с клиниками, страховщиками, врачами и сталкиваются с совершенно другим уровнем доказательности. Что обычно приходится переделывать? И что стоило бы предусмотреть еще на старте?

— Большую часть работ по переделке можно предотвратить, причем сделать это относительно недорого. Изучите ситуацию в отрасли, прежде чем писать код, и не закрывайте для себя путь в сферу медицины, даже если сегодня вы создаете продукт для поддержания хорошего самочувствия (wellness-продукт). Если упустить этот момент, то впоследствии придется переделывать не интерфейс, а саму основу: данные, архитектуру, доказательную базу и бизнес-модель.

— Что самое дорогое/сложное в переходе от работающего хелстек-продукта к продукту, который должен выдержать клиническую и регуляторную проверку: данные, исследования, архитектура продукта, документация, процессы или что-то другое?

— Говоря честно и с долей иронии, дороже всего обходится время, уже потраченное на то, что теперь приходится переделывать. Если говорить серьезно, то с финансовой точки зрения самые большие затраты связаны с клиническими доказательствами. А с точки зрения рисков опаснее всего — выбрать неверное назначение (intended use) или пытаться задним числом подогнать требования к продукту, который изначально создавался без их учета.

Более подробно о том, что следует иметь ввиду стартапам до того, как возникнет необходимость клинической валидации продукта (работа с данными, архитектура, документация, бизнес-модель), читайте в ближайшее время на BYGRID.

Поделиться