Исследование / HealthTech
·7 мин чтения
AI используют 71% хелстек-стартапов.Как они доказывают, что их софт действительно хорош?
У 20 из 28 хелстек-стартапов с беларусскими корнями искусственный интеллект — неотъемлемая часть продукта: персонализирует тренировки, анализирует питание, распознает новообразования на коже или сердечный ритм. Посмотрели, как компании проверяют свои технологии — от точности алгоритмов и изменений у пользователей до клинических исследований и медицинской сертификации.
Клинические исследования
Проверка технологии
Оценка изменений у пользователей
Академические упоминания
Регулирование
/ сертификация
- 20 / 28
- Используют AI как часть продукта
- 12 / 28
- Есть публичный научный, клинический или регуляторный след
- 16 / 28
- Публичных сигналов не обнаружено
Содержание
00Об исследовании
Это второй текст на основе HealthTech in Motion — исследования о международных хелстек-стартапах, основанных беларусами. В первой части мы разбирались, кто сегодня создает проекты в сфере здоровья, почему три четверти компаний запускают уже опытные основатели. Сегодня поговорим о том, что стоит за их технологиями. Согласно ресерчу, у 16 из 28 компаний (57%) публичных научных, клинических или регуляторных сигналов не обнаружено (но это не означает, что технологии не тестируются или не работают). У оставшихся 12 публичный след есть и выглядит по-разному.
- Есть публичный научный, клинический или регуляторный сигнал
- 12
- Публичных сигналов не обнаружено
- 16
Отсутствие публичного сигнала не означает, что технология не тестируется или не работает.
01Проверка технологии
Когда проверяют саму технологию
Например, Skinive, AI-сервис для распознавания проблем с кожей, тестировал точность алгоритма распознавания патологий. В опубликованной работе компания сравнила две версии, обученные на 64 тыс. и 115 тыс. изображений. Для злокачественных новообразований чувствительность более свежей версии достигала 95,4%.
HeartScan, приложение для мониторинга работы сердца с помощью смартфона, проверял, как алгоритм распознает события сердечного цикла. Для этого использовали 7 700+ часов записей акселерометра в условиях шума, движения, собранных с разных моделей смартфона. Лучшая версия алгоритма обнаруживала момент открытия аортального клапана с точностью 99,8%. Пока работа опубликована как препринт.
Doctorina, AI-сервис для медицинских консультаций, пошел другим путем: команда сравнила диагностические результаты своего алгоритма с результатами врачей и других AI-моделей. Для этого использовали 150 смоделированных консультаций первичной помощи. Диагноз Doctorina совпал с референсными в 82% случаев против 57% у врачей. Кроме того, алгоритм стартапа показал самую высокую точность диагностики по сравнению с frontier-моделями (Claude Opus 5, GPT-5.6, Gemini 3.1 Pro, Kimi K3). Это исследование также пока опубликовано как препринт.
Skinive
95,4%
HeartScan
99,8%
Doctorina
82% vs 57%
Здесь измеряют разные показатели на разных данных. Эти проценты нельзя сравнивать как рейтинг продуктов.
02Оценка изменений у пользователей
Когда исследуют не только алгоритм
Flo Health, приложение для женского здоровья, исследует разные аспекты своего продукта. Например, два пилотных рандомизированных исследования с участием более 400 женщин касались роли образовательного контента в вопросах менструального здоровья, ПМС и ПМДР. По окончании исследований, которые длились три месяца, участницы стали лучше разбираться в вопросах женского здоровья, отметили улучшение некоторых показателей. А группа с ПМС и ПМДР — снижение выраженности симптомов. Кроме того, компания проверяла точность своего Symptom Checker на смоделированных случаях эндометриоза, миомы и синдрома поликистозных яичников. В 83–88% случаев выводы компании совпали с оценками независимых врачей. В этом году Flo зарегистрировала исследование функции цифровой контрацепции.
Goodville, мобильная игра, которая использует игровые механики для поддержки ментального здоровья, изучала не алгоритм, а изменения у пользователей. Компания провела 6-недельное исследование более чем 1 700 человек с симптомами депрессии. Около 60% сообщили об уменьшении выраженности симптомов за рассматриваемый период. Но важно отметить: исследование было наблюдательным, без рандомизации и контрольной группы. То есть оно фиксировало изменения у пользователей в моменте, но не доказывало, что именно приложение стало их причиной.
CleverPoint, платформа для оценки психофизиологического состояния на основе EEG/ECG и виртуальный реальности, выступала не объектом, а инструментом исследования. С её помощью у 400+ судовых офицеров и инженеров оценивали реакцию мозга и тела на когнитивную нагрузку. У 73,8% участников обнаружили выраженный стресс, а у участников старше 40 лет — снижение когнитивных функций в условиях стресса. То есть здесь исследовали не точность CleverPoint, а состояние людей с помощью технологии.
Flo Health
- Женщин в двух пилотных рандомизированных исследованиях
- 400+
- Совпадение Symptom Checker с оценками независимых врачей
- 83–88%
Зарегистрировано исследование цифровой контрацепции
Goodville
~60%
CleverPoint
73,8%
03Клиническая проверка
От пилота с 40 детьми до тестирования на 1 000 пациентах
Еще три стартапа, согласно исследованию, находятся на той или иной стадии клинической проверки. Bloom, AI-нутрициолог и трекер питания, говорит в материалах для инвесторов о тестировании клиниками. VR NeuroLink AI, разработчик VR-технологии для нейрореабилитации, сообщает о проверке продукта на 1 000+ пациентах. MindMuscle, нейрофидбек-платформа и EEG-гарнитура для детей с СДВГ, — о пилоте с 40+ детьми и работе с пятью педиатрическими клиниками в США.
Поскольку методология и результаты этих проверок публично недоступны, невозможно определить, что они показали. Поэтому эти кейсы в ресерче учитываются отдельно от опубликованных научных работ.
Bloom
Клиники
VR NeuroLink AI
1 000+
MindMuscle
40+
Методология и результаты публично недоступны. Эти кейсы учтены отдельно от опубликованных научных работ.
04Академический след
Когда стартап попадает в поле зрения ученых
Еще несколько стартапов из выборки попали в независимые научные работы. Хотя присутствие в академической литературе не означает однозначную эффективность продукта: в обзоре может быть и полноценный анализ, и простое упоминание в качестве примера.
Например, Skinive минимум дважды попадал в поле зрения независимых исследований: приложение сравнивали с другими AI-сервисами для анализа кожи – по заявленной точности, участию врачей, регуляторному статусу, тому, насколько полно продукт раскрывает информацию пользователям. Stork, приложение для трекинга беременности, также анализировалось в независимом исследовании приложений для самоконтроля во время беременности наравне с другими продуктами.
В то время как Soula приводилась как пример существующего решения, а данные из исследования Zing Coach использовались в рамках академической публикаций, но без оценки эффективности самого приложения.
- Skinive
- Сравнение с другими AI-сервисами для анализа кожи
- Stork
- Анализ в исследовании приложений для самоконтроля во время беременности
- Soula
- Упоминание как примера существующего решения
- Zing Coach
- Использование данных исследования без оценки эффективности приложения
Присутствие в научной работе само по себе не подтверждает эффективность продукта.
05Регулирование, ISO, патенты
Другие признаки "зрелости": регулирование, ISO, патенты
Для некоторых хелстек-продуктов исследованиями дело не ограничивается: если стартап намерен использоваться в медицинских целях, ему придется пройти процедуру регуляции как медицинского изделия. В выборке такой трек есть у двух компаний: Skinive — имеет CE-маркировку (медицинское изделие класса I по EU MDR) и VR NeuroLink AI (проходит сертификацию как медицинское изделие класса IIa).
Среди других признаков зрелости компаний: патенты и стандарты менеджмента. Skinive сертифицирован по ISO 13485 – стандарту управления качеством при разработке медицинских изделий. Flo Health имеет сертификаты ISO 27001 и ISO 27701 в области информационной безопасности и приватности данных (и по сообщению компании, является единственным femtech-приложением, сертифицированным по обоим стандартам). MindMuscle получил в США патент на свою EEG-гарнитуру.
- Skinive
- CE · класс I
- Медицинское изделие по EU MDR. ISO 13485 — управление качеством при разработке медицинских изделий.
- VR NeuroLink AI
- Класс IIa · в процессе
- Проходит сертификацию медицинского изделия.
- Flo Health
- ISO 27001 · ISO 27701
- Информационная безопасность и приватность данных.
- MindMuscle
- Патент в США
- На EEG-гарнитуру.
06Комментарий эксперта
Когда хороших метрик уже недостаточно
Как видим, единой лестницы доказательности в HealthTech нет. Алгоритм анализа сигналов сердца или медицинское ПО для оценки новообразований на коже решают разные задачи. Соответственно, им требуются разные исследования и разные уровни доказательности. Где проходит эта граница и в какой момент продукту в сфере цифрового здоровья вообще нужна клиническая валидация? Комментирует руководитель технологической компании с многолетним опытом разработки digital health-продуктов для американского рынка, включая проекты для крупных госпиталей и healthcare enterprises. Компания реализовала несколько сотен проектов. Эксперт попросил сохранить анонимность.
Показатель удержания (retention) говорит лишь о том, что люди пользуются продуктом. Но он не доказывает эффективность продукта.
Эксперт попросил сохранить анонимность
— В какой момент хелстек-стартапу становится недостаточно того, что продукт просто нравится пользователям и показывает хорошие метрики? Что обычно заставляет компанию переходить к клинической валидации, начинать регуляторный путь?
— Если кратко, то, исходя из нашего опыта, не метрики подталкивают стартап к прохождению клинической валидации. Решающее значение имеют два фактора: желание стартапа заявить о медицинских свойствах продукта и появление плательщика, отличного от самого пользователя (например, клиники, страховой компании или работодателя). Показатель удержания (retention) говорит лишь о том, что люди пользуются продуктом. Но он не доказывает эффективность продукта, а именно это и хочет знать новый покупатель.
— Насколько сильно заявленная функциональность (claims) может менять продукт? Например, один стартап помогает лучше понимать сон, второй — выявлять риск заболевания. Технически они могут использовать похожие AI-модели. Что принципиально меняется во втором случае?
— Заявления — то есть обещания, которые стартап дает пользователям и рынку, — определяют предполагаемое назначение продукта. А именно назначение определяет, считается ли продукт медицинским изделием. Сама модель может быть идентичной, но продукты — разными. В зависимости от claims меняется все, что окружает модель: цена ошибки, требования к данным, процесс разработки и даже свобода обновления модели.
— Часто стартапы начинают как consumer/wellness/B2C-продукт, а потом хотят работать с клиниками, страховщиками, врачами и сталкиваются с совершенно другим уровнем доказательности. Что обычно приходится переделывать? И что стоило бы предусмотреть еще на старте?
— Большую часть работ по переделке можно предотвратить, причем сделать это относительно недорого. Изучите ситуацию в отрасли, прежде чем писать код, и не закрывайте для себя путь в сферу медицины, даже если сегодня вы создаете продукт для поддержания хорошего самочувствия (wellness-продукт). Если упустить этот момент, то впоследствии придется переделывать не интерфейс, а саму основу: данные, архитектуру, доказательную базу и бизнес-модель.
— Что самое дорогое/сложное в переходе от работающего хелстек-продукта к продукту, который должен выдержать клиническую и регуляторную проверку: данные, исследования, архитектура продукта, документация, процессы или что-то другое?
— Говоря честно и с долей иронии, дороже всего обходится время, уже потраченное на то, что теперь приходится переделывать. Если говорить серьезно, то с финансовой точки зрения самые большие затраты связаны с клиническими доказательствами. А с точки зрения рисков опаснее всего — выбрать неверное назначение (intended use) или пытаться задним числом подогнать требования к продукту, который изначально создавался без их учета.
Более подробно о том, что следует иметь ввиду стартапам до того, как возникнет необходимость клинической валидации продукта (работа с данными, архитектура, документация, бизнес-модель), читайте в ближайшее время на BYGRID.