본문으로 바로가기
AI 뉴스 목록
MarkTechPost2026. 09. 06.

Adaption Labs가 기초 데이터 없이 작업 설명만으로 AI 학습 데이터를 자동 생성하는 'Invent a Dataset'을 출시해 모델 훈련 절차를 대폭 단축했다.

기사 3줄 요약

  1. 1Adaption Labs가 모델에게 학습시키고 싶은 행동 설명만으로 학습용 데이터를 생성하는 'Invent a Dataset'을 출시했다.
  2. 2시드 코퍼스(초기 데이터)나 스키마 설계, 라벨링 가이드 없이 단 한 번의 datasets.invent 호출로 도메인, 행 수, 출력 형식, 언어 확장을 설정할 수 있다.
  3. 3생성된 데이터는 JSONL, JSON, CSV, Parquet 형식으로 다운로드되며, 데이터 ID를 AutoScientist에 바로 전달해 의도 입력부터 모델 훈련까지의 과정을 자동화한다.

초등학생도 이해하는 NEWS 설명

우리가 요리를 할 때 재료를 일일이 손질하지 않고 원하는 요리 설명만 하면 완성된 손질 재료가 바로 나오는 것과 같습니다.

기존에는 AI를 훈련시키기 위해 사람이 직접 수많은 본보기 데이터(시드 코퍼스)를 모으고 정리해야 했습니다.

이제는 AI에게 '어떤 행동을 학습하고 싶은지' 글로 설명하기만 하면 알아서 맞춤형 훈련 데이터를 만들어 줍니다.

인사이트 & 시사점

기존에는 기초 데이터 수집과 라벨링 규칙 설계에 수주일이 소요되었으나, 설명문 입력 하나로 데이터 생성부터 AutoScientist를 통한 모델 학습까지 하나로 이어져 개발 속도가 대폭 향상됩니다.

데이터 수집 인력이 부족한 중소 개발사나 연구자가 원하는 특화 AI를 빠르게 시범 제작할 때 직접적인 효과를 볼 수 있습니다.

다만 합성 데이터의 정확도 검증 기준과 실제 도메인 적용 시 발생할 수 있는 오류율은 추가 조사가 필요합니다.

용어해설

Invent a Dataset

Adaption Labs가 출시한 AI 솔루션으로, 별도의 초기 데이터나 라벨링 작업 없이 단순한 자연어 설명만으로 AI 훈련용 데이터셋을 자동 생성해 주는 도구입니다.

AutoScientist

생성된 데이터셋의 식별자(ID)를 전달받아 AI 모델의 훈련과 파이프라인 구축을 자동으로 처리해 주는 개발 도구입니다.

시드 코퍼스 (Seed Corpus)

AI를 학습시키거나 새로운 데이터를 확장 생성할 때 출발점으로 사용되는 초기 기본 말뭉치(원천 데이터 모음)를 의미합니다.

공유하기