MCP로 AI가 편집하는 오디오 에디터, Audionaut

김팔복 2026-10-03 23:57:02
조회 59 추천 0 댓글 0

출처: GitHub kvoltmer/Audionaut 저장소 README
원문: https://github.com/kvoltmer/Audionaut
작성자: 팔복소프트-김팔복

한눈에 보기

  • Audionaut는 MCP를 지원하는 무료 오픈소스 멀티트랙 오디오 에디터로, Claude 같은 AI 에이전트가 편집 중인 프로젝트를 직접 수정할 수 있습니다.
  • 에이전트가 수정한 내용은 한 번에 실행 취소 한 단계로 기록되므로, 사람이 GUI에서 바로 되돌릴 수 있습니다.
  • GUI 없이 동작하는 audionaut-cli를 함께 제공해 스크립트나 CI에서도 같은 프로젝트 파일을 다룰 수 있습니다.
  • 비트 추적과 구간 분석에는 Essentia를, 드럼·베이스·보컬 분리에는 Meta Demucs의 C++ 포팅인 demucs.cpp를 씁니다.
  • JUCE 기반 C++로 작성되어 Windows, macOS, Linux에서 네이티브로 동작합니다.
  • 라이선스는 GPL3 이상과 상용 라이선스를 함께 제공하는 듀얼 라이선스입니다.
  • 확인 시점 기준으로 커밋은 1,271개지만 Star는 1개로, 외부 검증은 거의 없는 단계입니다.

배경

MCP(Model Context Protocol)는 AI 에이전트가 외부 도구를 호출하는 방식을 표준화한 프로토콜입니다. 지금까지 MCP 서버는 GitHub, Slack, DB처럼 텍스트와 데이터를 다루는 도구에 몰려 있었습니다. 오디오 작업은 결과물이 파형과 타임라인이라 에이전트가 직접 다루기 어려웠고, 개발자들은 보통 ffmpeg이나 sox로 스크립트를 짜서 처리해 왔습니다.

주요 내용

에이전트가 렌더링 결과가 아니라 '세션'을 만진다

이 프로젝트의 핵심은 에이전트가 완성된 오디오 파일이 아니라 편집 중인 프로젝트를 수정한다는 점입니다. Node.js 18 이상이 설치된 환경이라면 Claude Code에 audionaut-mcp npm 패키지를 MCP 서버로 등록하는 것으로 설정이 끝납니다.

앱에서 프로젝트를 열어 둔 상태라면 에이전트의 수정이 실시간으로 반영됩니다. 수정 하나하나가 undo 단위로 쌓이기 때문에, 에이전트가 엉뚱한 위치를 잘라도 사람이 Ctrl+Z로 되돌리면 됩니다. README의 데모에서는 곡을 일정 마디마다 자르고 두 트랙에 나눠 배치한 뒤 크로스페이드와 페이드아웃을 거는 과정을 보여줍니다.

헤드리스 CLI와 자동화 친화적인 출력

audionaut-cli는 오디오 장치나 화면 없이 .audium 프로젝트를 다룹니다. 지원하는 명령은 다음과 같습니다.

  • 프로젝트 생성과 파일 가져오기
  • 분석, 자동 편집
  • 마디 단위 분할, 리전(구간) 지정
  • 클립 게인과 페이드 조절
  • 스템 분리, 내보내기
    CLI로 만든 프로젝트는 GUI 앱에서 열 수 있고, 반대 방향도 됩니다.

모든 명령에 --json을 붙이면 표준 출력에는 성공 여부가 담긴 결과 객체 하나만 나오고, 로그는 전부 표준 에러로 분리됩니다. 종료 코드는 다음과 같이 나뉩니다.

종료 코드 의미
0 성공
1 작업 실패
2 사용법 오류
3 현재 빌드에서 쓸 수 없는 기능 (예: Essentia 없이 분석 요청)

간단한 사용 흐름은 이렇습니다. 파일명은 예시입니다.

audionaut-cli create lecture.audium --channels 1
audionaut-cli import lecture.audium part1.wav part2.wav
audionaut-cli export lecture.audium -o lecture_final.wav --json

도입 전에 확인할 제약

  • 분석 기능 빌드: 분석 기능(Essentia)은 선택 사항입니다. 빌드하려면 Python 3.11 이하(3.12에서 distutils가 제거됐기 때문), pkg-config, CMake 3.x가 필요하며, 조건을 갖추지 못하면 분석 기능만 빠진 채로 빌드됩니다.
  • 스템 분리 모델: 모델 가중치는 저장소에 포함되어 있지 않습니다. 앱이 첫 사용 시 내려받고, CLI에서는 --model로 경로를 지정할 수 있습니다.
  • macOS 샌드박스: macOS 앱은 샌드박스 환경이라 MCP나 앱 내장 CLI를 쓸 때 프로젝트를 Music 폴더에 둬야 합니다. 별도로 빌드한 audionaut-cli에는 이 제한이 없습니다.
  • Windows: 앱 출력이 셸과 섞이므로 스크립팅에는 audionaut-cli를 쓰는 편이 낫습니다.
  • 사용 통계: 앱 설정에서 동의한 경우에만 전송됩니다. CI에서는 AUDIONAUT_DISABLE_ANALYTICS=1로 확실히 끌 수 있습니다.

기존 도구와 비교 (편집자 정리)

구분 Audionaut Audacity ffmpeg / sox REAPER
형태 GUI + 헤드리스 CLI GUI 중심 CLI GUI 중심 DAW
멀티트랙 프로젝트 있음, CLI·GUI 공유 있음 없음 (파일 단위) 있음
에이전트 연동 MCP 공식 제공 스크립팅 모듈 경유 셸 명령으로 간접 연동 ReaScript 경유
비용 무료 (상용 라이선스 별도) 무료 무료 유료
성숙도 초기 매우 높음 매우 높음 높음

팔복소프트 관점

국내에서 쓸모가 있는 쪽은 콘텐츠 자동화입니다. 이러닝 강의 음성, 사내 팟캐스트, 숏폼 영상처럼 음성 후처리를 반복하는 팀이 대상입니다. 이런 팀은 지금 ffmpeg 스크립트로 기계적인 처리를 하고, 판단이 필요한 편집은 사람이 손으로 합니다. Audionaut는 에이전트가 1차 편집을 하고 사람이 같은 도구에서 검수하고 되돌리는 분업을 가능하게 합니다. ffmpeg에는 없는 차별점입니다.

다만 기능의 중심이 음악입니다. 분할과 자동 편집의 기본 단위가 마디와 비트이고, 필러 단어 제거나 무음 구간 컷 같은 말소리 편집 기능은 README에 명시되어 있지 않습니다. 팟캐스트 편집 자동화를 기대하고 들어가면 원하는 기능이 없을 수 있습니다.

성숙도는 냉정하게 봐야 합니다. 커밋 수에 비해 외부 사용자와 기여자가 거의 없습니다. 운영 파이프라인에 넣기보다는 개인 작업이나 PoC 수준에서 써 보길 권합니다.

라이선스는 사용 방식에 따라 달라집니다. 사내 서버에서 CLI를 돌리는 것과 자사 제품에 포함해 배포하는 것은 GPL 의무가 다릅니다. 후자라면 상용 라이선스 검토가 필요합니다. 기여할 때도 CLA 서명이 필요하므로 회사 소속 개발자는 사내 정책을 먼저 확인해야 합니다.

망분리 환경이라면 미리 준비해야 합니다. 금융·공공 쪽 폐쇄망에서는 Demucs 모델을 첫 사용 시 자동으로 받을 수 없으니, 미리 반입해 두고 --model로 경로를 지정해야 합니다.

오디오와 무관한 개발자에게도 참고할 점이 있습니다. JSON 결과 객체, 의미가 구분된 종료 코드, undo 단위의 변경, CLI와 GUI가 같은 파일을 공유하는 구조는 에이전트 친화적인 도구 설계의 좋은 사례입니다. 사내 도구에 MCP를 붙일 계획이 있다면 README의 CLI 섹션을 한 번 읽어볼 만합니다.

정리

Audionaut는 "AI가 작업하고 사람이 같은 화면에서 고친다"는 구조를 오디오 편집에 처음으로 제대로 가져온 사례입니다. 지금 당장 실무 도구로 쓰기에는 이르지만, 에이전트에 넘길 작업의 단위를 어떻게 설계할지 고민하는 팀이라면 구조를 살펴볼 가치가 있습니다. 실제로 도입할 때는 라이선스, 빌드 의존성, 모델 다운로드 경로 세 가지를 먼저 확인하세요.


  • MCP
  • AI 에이전트
  • 오디오 편집
  • CLI 자동화
  • JUCE

댓글 0

아직 댓글이 없습니다.