GitHub (США) опубликовал многоязычный набор данных репозиториев, охватывающий более 40 миллионов проектов
2026-06-16 09:37
В избр.

Репортаж от Wedoany,GitHub выпустил набор данных многоязычных репозиториев (GitHub Multilingual Repositories Dataset). Этот набор метаданных на уровне репозиториев предназначен для помощи исследователям и разработчикам в поиске публичных репозиториев GitHub, содержащих неанглоязычный естественный текст. При создании набора данных распределение языков в файлах README, issue и pull request оказалось различным: корейский язык является наиболее распространённым неанглийским языком в текстах issue, но занимает лишь пятое место в README; португальский язык лидирует среди неанглийских README, охватывая более трёх миллионов репозиториев. По мере того как ИИ играет всё более важную роль в процессе разработки программного обеспечения, многоязычный контент разработчиков становится критически важным. Набор данных опубликован на GitHub под лицензией CC0-1.0, что выполняет обещание GitHub, данное в 2025 году в рамках Европейских цифровых обязательств Microsoft (Microsoft's European Digital Commitments), — сделать многоязычные данные более доступными, в том числе для разработчиков открытого ИИ.

Этот набор данных не является дампом содержимого репозиториев, а представляет собой набор метаданных, включающий более 80 миллионов классифицированных записей, охватывающих более 40 миллионов репозиториев. Для каждого публичного репозитория предоставляется следующее: языковая классификация README, наиболее комментируемого issue и наиболее комментируемого pull request, где в качестве входных образцов берутся первые 150 символов каждого текста, исключая тексты короче 20 символов; результаты классификации для каждого текстового источника получены с помощью fastText, gcld3 и lingua-py, каждая запись сопровождается оценкой достоверности, и набор данных включает только классификации с достоверностью более 0,5; метаданные репозитория включают временную метку создания, использование диска, количество звёзд, количество форков, основной язык программирования, лицензию SPDX, количество issue и pull request, а также дату снимка. GitHub намеренно не объединяет три классификатора в одну метку, поскольку они различаются по охвату и калибровке достоверности, особенно для языков с ограниченными ресурсами. Предоставляя все три результата классификации, пользователи могут самостоятельно определять уровень строгости.

Этот набор данных может использоваться для поиска репозиториев, которые могут содержать документацию или совместную работу разработчиков на определённом языке; для изучения того, как неанглоязычные сообщества разработчиков используют issue, pull request и README; для создания оценочных наборов для инструментов ИИ-кодирования, генераторов документации или помощников по рецензированию (эти инструменты должны хорошо работать на нескольких языках); для поддержки аргументов лиц, принимающих решения, о необходимости расширения языкового охвата на основе данных о многоязычном разнообразии разработчиков; а также для измерения представленности европейских и других недостаточно представленных языков в открытом исходном коде. Распознавание языка в программных репозиториях затруднено, так как тексты в репозиториях часто короткие, могут содержать значки, шаблоны, команды установки, фрагменты кода, имена пользователей или смешанный языковой контент, и образец из 150 символов может не представлять весь репозиторий. Поэтому данный набор данных не следует рассматривать как эталонный стандарт для распознавания языка, а как прозрачный инструмент для обнаружения. Набор данных также не следует использовать для вывода конфиденциальных атрибутов владельцев репозиториев, участников или сообществ — эти сигналы являются метаданными на уровне репозитория, а не атрибутами на уровне личности.

Многие европейские языки по-прежнему недостаточно представлены в онлайн-текстах, используемых для создания и оценки систем ИИ, что может привести к тому, что инструменты ИИ будут хорошо работать для одних разработчиков, языков и сообществ, оставляя другие группы позади. Открытые данные помогают сократить этот разрыв. Этот набор данных был создан потому, что контент разработчиков отличается от обычных веб-текстов: README, issue и pull request содержат язык программной коллаборации, такой как инструкции по установке, отчёты об ошибках, запросы функций, рецензионные комментарии и нормы сообщества. Эти контексты помогают создавать системы ИИ, которые лучше понимают реальную работу разработчиков. Делая сигналы многоязычного контента разработчиков более доступными для обнаружения и анализа, этот набор данных предоставляет исследователям, разработчикам открытого исходного кода и создателям моделей инструменты для изучения языковой представленности в разработке программного обеспечения, помогая выявлять пробелы, поддерживать более качественную оценку и создавать более инклюзивные инструменты ИИ для разработчиков в Европе и за её пределами.

GitHub обсудит этот набор данных и более широкое значение открытых данных для многоязычного ИИ 16 июня в Центре открытого инновационного диалога (Open Innovation Dialogue Hub) в Страсбурге. Мероприятие, организованное Центром открытых инноваций Microsoft (Microsoft Open Innovation Center), Советом Европы (Council of Europe) и GitHub, соберёт политиков, исследователей, культурные учреждения и лидеров открытых инноваций для обсуждения ИИ, языкового разнообразия, культурного наследия и открытых данных.

Данный материал скомпилирован платформой Wedoany. При цитировании материалов, созданных с помощью искусственного интеллекта (ИИ), необходимо обязательно указывать источник — «Wedoany». В случае выявления нарушения прав или иных проблем просим своевременно информировать нас. Сайт оперативно внесёт изменения или удалит материал.Электронная почта: news@wedoany.com

Эта новость является результатом компиляции и перепечатки информации из глобального Интернета и стратегических партнеров. Она предназначена только для читателей. Если у вас возникнут какие-либо нарушения или другие проблемы, пожалуйста, своевременно сообщите нам. Этот сайт изменить или удалить ее. Перепечатка этой статьи без официального разрешения строго запрещена.электронная почта:news@wedoany.com
Связанные продукты
Последние новости
1
Правительство Португалии одобрило пересмотр плана прибрежной зоны Овар — Маринья-Гранди
2
Португалия завершила создание особой охранной зоны в устье реки Тежу
3
Чилийская Codelco приостанавливает расширение Andes Norte из-за сейсмического риска
4
Holcim México инвестирует 200 миллионов песо в строительство объекта по переработке 45 тысяч тонн сахарной биомассы в год для снижения выбросов
5
Мексиканская Fibra Mty в марте приобрела заводы в Коауиле и Гуанахуато за 100 миллионов долларов
6
Исследование: к 2050 году критически важные полезные ископаемые могут принести бразильскому ВВП 192,1 млрд реалов
7
Австралийский штат Виктория дополнительно заказывает 25 поездов Alstom на сумму 270 млн евро
8
Дубай и Oxa создают SHIFFT: автономная логистика в аэропортах к 2027 году
9
VietJet откроет два рейса на Себу (Филиппины) в ноябре, выручка за первое полугодие выросла на 44%
10
Швейцарская компания Comfone и VOX заключили стратегическое партнерство
Связанные рекомендации
Швейцарская компания Comfone и VOX заключили стратегическое партнерство
2026-08-05
Мобильная экономика Латинской Америки достигнет 700 млрд долларов к 2030 году, инвестиции в сети — 75,8 млрд долларов
2026-08-05
SoftBank и другие подписали меморандум о развертывании центров обработки данных ИИ в Малайзии и других странах
2026-08-05
Hyundai Motor India продвигает интеллектуальное производство: более 2000 единиц оборудования подключено к промышленной сети
2026-08-05
Американская Broadcom присоединилась к открытому альянсу безопасного ИИ от Nvidia, возглавив открытые инициативы по безопасности корпоративного ИИ
2026-08-05
Liqid развертывает пул памяти CXL объемом 160 ТБ для PNNL в США
2026-08-05
CoreWeave расширяется в Индонезию: развертывание центров обработки данных мощностью 360 МВт к 2028 году
2026-08-05
В Корее ETRI строит океаническую IoT-сеть, 5800 навигационных знаков будут выполнять функцию базовых станций
2026-08-05
Министерство торговли США одобрило окончательный план исследований спектра 4,4 ГГц
2026-08-04
Китайская Huawei предлагает интеллектуальную сеть IPv6+ для объединения всех вычислительных мощностей страны в единый компьютер
2026-08-04