
Данная модель способна без дополнительной донастройки выполнять широкий спектр задач: классифицировать стандартные ультразвуковые срезы, определять гестационный возраст, сегментировать анатомические структуры и выявлять врожденные пороки сердца по видеозаписям. Разработка показала высокие результаты: средний F1 при распознавании срезов — 87,1%.
Авторы подчеркнули, что успех обеспечил крупный мультимодальный датасет, где клинические изображения дополнялись автоматически сгенерированными текстовыми описаниями с помощью GPT‑4o. Также они отметили, что модель преимущественно обучалась на данных второго триместра и пока не предназначена для автономной клинической диагностики.