Снова обновлена "Копилка" (5 апреля 2024 г.)

Дорогие друзья!

В эфире снова новости компьютерного зрения. Напомним, что в восьмой модели автоматического распознавания видов, которая была запущена 19 августа 2022 г., были использованы новые критерии отбора видов для обучающего датасета: теперь минимальный порог равен не ста наблюдениям, а ста фотографиям. С осени 2022 г. примерно раз в месяц те виды, которые добрались до квалификационного порога, добавляются в модель без пересчёта включенных ранее видов. Это позволило заметно ускорить включение новых растений.

Новая модель (v2.12, т.е. двеннадцатая ежемесячная порция обновлений "большой" второй модели) основана на данных, выгруженных из системы 2 февраля 2024 г. - в ней появилось сразу 606 новых видов растений, в т.ч. 45 видов проекта "Флора России".

После этого дополнения модели, мы быстро сделали чистку "Копилки флоры России". Оказалось, что с 2 февраля 2024 г. ещё 26 видов копилки (из 500) стали известны системе, и она их предлагает пользователям при определении снимков:

Delphinium puniceum Живокость пунцовая
Smelowskia alba смеловския белая
Phlojodicarpus villosus Вздутоплодник волосистый
Verbascum spectabile Коровяк блестящий
Taraxacum porphyranthum Одуванчик пурпуровый
Oxytropis setosa Остролодочник щетинистоволосистый
Cicerbita prenanthoides Цицербита пренантоидная
Viola caucasica Фиалка кавказская
Ligularia subsagittata Бузульник полустреловидный
Allium kunthianum Лук Кунта
Cherleria circassica Минуарция черкесская
Erysimum aureum Желтушник золотистый
Salix saxatilis Ива скальная
Vicia crocea Горошек оранжевый
Scabiosa bipinnata Скабиоза дваждыперистая
Veronica daurica вероника даурская
Prenanthes petiolata Косогорник черешковый
Echinops tataricus Мордовник Татарский
Ferula songarica Ферула джунгарская
Delphinium dictyocarpum Живокость сетчатоплодная
Saussurea pricei Соссюрея Прайса
Potamogeton friesii Рдест Фриза
Fritillaria latifolia Рябчик широколистный
Rorippa barbareifolia Жерушник сурепицелистный
Papaver arenarium Мак песчаный
Leonurus deminutus Пустырник уменьшенный

Некоторые виды (с большинством наблюдений из-за границы или с большим числом фотографий при малом числе наблюдений) прошли порог, так и не побывав в нашей копилке:

Daphne pontica Волчеягодник понтийский
Draba alpina Крупка альпийская
Colchicum trigynum Безвременник трёхстолбиковый
Ulmus macrocarpa Вяз крупноплодный
Cyperus pannonicus Ситничек венгерский
Stuckenia filiformis Рдест нитевидный
Crataegus chlorocarpa Боярышник зеленоплодный
Sium sisarum Поручейник сахарный
Carex microglochin Осока мелкоостренник
Draba nivalis Крупка снежная
Ranunculus longirostris Лютик длинноклювый
Centaurea virgata
Calamagrostis inexpansa Вейник сжатометельчатый
Aeluropus littoralis Прибрежница солончаковая

Итак, каждый месяц ещё несколько десятков видов флоры России становятся известными моделям компьютерного зрения iNaturalist. В большинстве регионов свыше 95% загружаемых фотографий (в Средней России 99%) относится к таким видам, которые известны системе, а, значит, чем лучше и правильнее пользователь фотографирует объект, тем больше шансов, что он сразу получит верный ответ.

Компьютерное зрение как часть технологий искусственного интеллекта сделало возможным распознавание живых организмов по изображениям. Ещё двадцать с лишним лет назад вдохновлённые люди рассказывали о том, что развитие молекулярных методов приведёт к тому, что в руках учёного будет устройство размером с пульт от телевизора, в него можно будет положить кусочек листика, и машина с точностью сможет определить вид этого растения. Сейчас прогресс дошёл до того, что нужно просто взять смартфон, навести камеру на растение, сфотографировать его, и мы получим, причём с очень большой долей надёжности, ответ на вопрос, что это такое. О том, что такое компьютерное зрение платформы iNaturalist рассказано в лекции А.П. Серегина.

Уже после записи этой лекции в сентябре 2023 г. произошло исключительно важное событие - теперь для подсказок системы компьютерного зрения используются не данные о реальных находках, а так называемые "модели" (вероятностные карты возможных встреч вида). Этому посвящен отдельный пост (перевод на русский). Несмотря на то, что некоторые подсказки выглядят странными, их общая точность повысилась, поэтому именно моделям был отдан приоритет.

Если вам действительно важно быстро узнать, что это за растение, не дожидаясь отклика экспертов (что важно во время летнего пика наблюдений), неторопливо делайте аккуратные снимки с разных ракурсов и обязательно перечитайте пост "Как снимать, что снимать: учимся у классиков. Особенно это актуально летом, когда возможности экспертного сообщества на порядок ниже потока свежих летних фотографий.

После обновления копилки на место исключенных видов в "Копилку" добавлено 25 дополнительных видов. В итоге, наш список снова включает 500 видов. Как и прежде, после выхода обновлений мы будем регулярно менять виды, преодолевшие этот порог, на те, что находятся ниже по списку.

Ждём выход большой третьей модели, чтобы сделать текущую сверку покрытия модели и привести копилку в порядок перед началом нового полевого сезона.


КАКОВА ТОЧНОСТЬ ПОДСКАЗОК?

Давайте внимательно посмотрим на график из последнего релиза. В нем сравниваются модели 2.11 (февраль 2024 г.) и 2.12 (апрель 2024 г.). Показано три категории столбиков: средние значения, разбивка по таксономическим группам и по континентам (странам света). У каждого столбика три доли: точность определения собственно по фото, добавка к точности с использованием геомоделей, добавка к точности новым алгоритмом поиска объекта на фото. Здесь рассматривается только точность первой подсказки на уровне вида.

В среднем, эти показатели по всем таксонам и континентам составляют 76% по фото + 11% по геомоделям + 2% по новому алгоритму поиска объекта. Итог: 89,1% наблюдений верно определяются компьютерным зрением.

Среди таксономических групп лучше всего по картинкам определяются именно растения. С учетом геомоделей - немножко выше относительно малочисленные амфибии (растения на втором месте). А с учетом нового алгоритма поиска объекта на фото - паукообразные (далее с минимальным отставанием амфибии и растения). Общая точность определения растений для модели 2.12 с первой посдказки в мире около 90% (78% по фото + 10% по геомоделям + 2% по новому алгоритму поиска объекта).

По частям света (независимо от таксонов) на первом месте Европа. Тут точность почти 92% (76% по фото + 13% по геомоделям + 3% по новому алгоритму поиска объекта). За ней следует Северная Америка, где точность первой подсказки 91% (78% по фото + 11% по геомоделям + 2% по новому алгоритму поиска объекта).

Так что друзья есть отличная новость для участников проекта "Флора России" и всех, кто загружает растения на iNaturalist: именно растения (а особенно сосудистые растения) и именно из Европы (а, на самом деле, из внетропических областей Евразии) - это то, что нашими общими усилиями iNaturalist определяет лучше всего.


АЛГОРИТМ ВКЛЮЧЕНИЯ ВИДОВ В КОПИЛКУ

1) Ждём выхода новой модели и релиза в блоге iNaturalist по этому поводу.
2) Берем полный список видов проекта "Флора России".
3) Скриптом проверяем, какие виды не включены в текущую модель компьютерного зрения.
4) Убираем из "Копилки" виды, попавшие в текущую модель.
5) Берем топ-500 видов по числу наблюдений проекта "Флора России" (в этот раз порог 30 наблюдений).
6) Добавляем ВСЕ их наблюдения с фото из всех стран в копилку - для обучения используются в т.ч. наблюдения, сделанные в культуре.
7) Делаем новые наблюдения этих видов, загружаем их на сайт, проверяем определения.
8) См. пункт 1.


КАК МОЖНО ПОМОЧЬ?

НОВЫЕ ДАННЫЕ. Поскольку теперь используется новый алгоритм для географического уточнения подсказок системы, то ещё более важными становятся новые наблюдения всех видов, в том числе обычных и хорошо знакомых системам компьютерного зрения. Каждая новая точка будет уточнять модели ареалов, а, значит, делать предсказания еще более точными.

НОВЫЕ ФОТО. Цель копилки - максимально ускорить процесс сбора фотографий по видам, которым чуть-чуть не хватает для включения в модель автоматического распознавания видов. Эти фото будут использованы в следующем обучающем наборе. Все мы замечаем, что каждый раз модель становится всё более компетентной и редко допускает грубые ошибки. Участники целенаправленно пополняют копилку, ориентируясь как на список видов (добавляя региональные фильтры), так и на карту, по которой мы можем глянуть на ближайшие точки видов-кандидатов и постараться сделать дополнительные наблюдения именно этих видов. Поверьте: такие поиски даже в соседнем лесу могут превратиться в увлекательное приключение! Но не забывайте, что из каждого наблюдения на обучение модели пойдёт только 5 фотографий (для соответствия критерию по разнообразию гаджетов).

Вот все формальные пороги для новых видов:

  • ранг вида (гибриды, подвиды и разновидности не включаются)
  • минимум 100 фото
  • 50% фото имеют определение сообщества
  • не более 5 фото из одного наблюдения

Иными словами, по текущим правилам, всего 20 исключительно полных наблюдений "исследовательского уровня" (минимум по 5 фото в каждом) достаточно для включения нового вида в модель.

Региональные примеры

НОВЫЕ ГАДЖЕТЫ. Для ряда видов имеется недостаточное разнообразие устройств: напрямую в релизах iNaturalist об этом не говорится, но Алекс Шепард в комментариях к постам рассказал, что наложены дополнительные ограничения на разнообразие источников, из которых поступают фотографии. При выгрузке обучающего набора фотографий из их метаданных берутся сведения, на какие устройства был снят тот или иной вид. К сожалению, точные значения пороговых отметок при этом не обнародованы. Если небольшое разнообразие устройств и наблюдателей не позволяет сделать обучающую выборку репрезентативной, то такой вид оставляется в сторонке для дальнейшего накопления данных. Такие ограничения вводятся потому, что, как показал эмпирический опыт, при обучении модель становится сильно зависимой от типа и марки устройств, на которые производилась съемка и, например, может узнавать какой-то вид, снятый на айфонах, но не видеть его на прочих фотографиях.

ДРУГИЕ ФЕНОФАЗЫ. Многие виды, которые не включены в систему, скупо представлены, например, в плодах или в вегетативном состоянии. А это особенно актуально осенью! Для надежного определения видов с помощью алгоритмов компьютерного зрения нужны фотографии растений в различные сезоны. Так что съемки одного и того же вида в том же месте, но, например, с жёлтыми листьями или ранней весной также очень полезны для совершенствования нейросетевых алгоритмов.

НОВЫЕ ОПРЕДЕЛЕНИЯ. Как и в целом на iNaturalist, очень многое зависит от экспертов и их работы. Несмотря на преодоление пороговых отметок, многие виды пока не включены в модель. Почему? У части видов пока недостаточная доля наблюдений исследовательского уровня (особенно у видов с большим числом наблюдений из-за рубежа, а также в сложных группах типа Salix, Carex, Poaceae и т.п.). Так что без участия экспертов в определении фото видов-кандидатов совершенствование модели компьютерного зрения невозможно в принципе. Например, довольно много видов флоры Приморья не включены в модель из-за большого числа неподтверждённых наблюдений из Южной Кореи.

РЕЗУЛЬТАТ. Именно первое включение вида в модель основано на наиболее чистом датасете фотонаблюдений, поскольку эти изображения вручную определены экспертами и наблюдателями (без учета мнения модели). Затем неизбежно начинают накапливаться ошибки, основанные на использовании подсказок, и обучение следующей модели хотя бы частично становится основанным на автоматически определенных фотографиях. Впрочем, обучающий массив при этом неизбежно растёт.



Подписались здесь на персональные уведомления журнала "Флора России": @natalia_gamova, @marina_gorbunova, @andrey_sdobnikov, @alexfamilyteam, @serycherny, @oleg_kosterin, @oksana_serikova, @taimyr, @yurii_basov, @madmanserg, @urij777, @tsn, @pavelsus, @denis_ivanov, @daba, @yuriydanilevsky, @julia_shner, @irinabobyleva, @tatyana_ilina, @windof, @petr_kosachev, @tanniii66, @grigoriy_yashin, @svetlanakutueva, @naturalist19358, @prokhozhyj, @forestru, @marina_sad, @tls-60, @cat_arch_angel, @irina_lebedeva83, @hoktokon, @daria_dru, @millione, @nikita_gerasin, @yuliaspiridonova, @woodmen19, @konstantin_shiryaev, @sennator, @stepan_vdovichenko, @nikolaydorofeev, @anaumkin, @svetlana-bogdanovich, @aleks-khimin, @pavelkomkov, @katya, @nikolay_sobolev, @dinanesterkova, @magrat666, @svetlana_katana, @irinasavenko, @liyixuan, @eugenia_urusova, @chimik, @naturalist57011, @tatianavladimirova, @v199rus, @wildpendulum, @dakileno, @gushchina_angelina, @pyakai, @danilinav, @npz, @tivanik, @okasana, @cyathus, @cryptobasis, @ev_sklyar, @caseymclowe, @mallaliev, @beerolha, @olga-2021, @olga_neogeo, @pamari, @alex_iosipenko, @alexander_ignatenko, @dni_catipo, @yaroslavmagazov, @naturalist34144, @zhu_lixun, @liyixuan, @iljar, @phlomis_2019, @savva_chigarkov, @sansan_94, @elena526, @ivan_savinov, @a-travva, @aleksandrebel, @eliooblomoff, @natalya_vilyaeva, @antropov_alexandr, @xueqiqi, @sokolkov2002, @pavel_golyakov, @aeroself, @alexanderdubynin, @pushai, @kristina_k, @tatiana_dolgova, @volnushka, @alexanderlakomov, @tatiana_moscow, @tomegatherion, @vladimirpenzyak, @vikaryabkova, @xueqiqi, @ksenia_urakova, @eremchi, @siburhan, @tatiana_gerasenko, @kazakovdenis, @zhang_luyu, @natalia_trifuz, @divitre, @dmitrii_mostovoi, @olga2019kuryakova, @evgeniyaast, @anastasiaredflower99, @anastasiya_spb, @svetlanakhanty, @ekaterinavoinova, @sergilus, @osting, @ninacourlee, @evgeny_ananyev, @irine_shlojmis, @wkent, @mariasakal, @elena_tikhonova, @evgeniq_benihanov, @ankhen, @radlena, @gerda_new, @komar281, @lilia_rakitianskaia, @igalka, @ganser8, @nikolai_nakonechnyi, @repta, @olya333555, @atachkin, @chortovatravka, @lebedeva_na, @sergey_shitov, @tatyanapopova, @oksana_serikova, @cvetlana, @ilya_rudenko, @anisimov-43, @olga_arishina, @olga_petrova, @krestov, @zhukovskaya, @dormidontovvladimir, @vlshl, @naturalist34144, @danila_kurochkin, @natur58, @konstantin_m, @kot_s76, @eugenia_wiskasoid, @veksha, @fretkus, @m2011, @sasha_sashevich, @olga_chernyagina, @natalya_fomina, @andrey_55, @mihail_antropov, @ceu4, @stanislav_murashkin, @anna_mitroshenkova, @ashache, @qoi, @al_fa, @odonatachr, @liya15, @jin_shiying, @irinabutorina, @polyabel, @applecat22, @kolesnikovnik, @tavridaalex, @sibhedgehog, @votinceva-elena, @lancos, @mmgafurova, @lyudmila_ryzhova, @sherehora, @evgeniya2301 (если вы заполняли форму, но вас тут нет, значит, вы написали свой ник с ошибкой - заполните форму ещё раз).

Publicado el 14 de abril de 2024 a las 03:35 PM por apseregin apseregin

Comentarios

No hay comentarios aún.

Añade un comentario

Entra o Regístrate para añadir comentarios