
Согласно изданию Wired, OpenAI разработала новый подход к пополнению датасета для тренировки ИИ-систем. По данным источников, компания собирает материалы на основе заданий, которые подрядчики решали в рамках иных проектов.
Смысл проекта заключается в запросе файлов с реальными примерами работ от подрядчиков. OpenAI принимает файлы в разных форматах — от таблиц Excel и документов Word до PDF и изображений.
Для уменьшения рисков с личными и секретными данными OpenAI создала инструмент для обработки файлов. Подрядчики обязаны с его помощью убирать конфиденциальную информацию, прежде чем материалы войдут в обучающий набор.
Однако специалисты указывают на потенциальные угрозы. Юрист в беседе с Wired подчеркнул: подрядчики рискуют не полностью удалить чувствительные данные из файлов. Даже с инструментом очистки сохраняется опасность случайной утечки.
Инициатива направлена на улучшение умений нейросетей OpenAI в офисных задачах. Новый датасет поможет моделям точнее работать с типовыми форматами документов, изучать шаблоны и эффективнее выполнять повседневные операции.
Представители OpenAI уклоняются от комментариев по поводу рисков утечек данных.
