「미디어 크리에이터」 — 이미지·영상·오디오 생성 담당
콘텐츠에 이미지·영상·음성이 들어가면 퀄리티가 확 달라집니다. 하지만 생성 도구마다 프롬프트 문법이 다르고, 계정도 따로입니다. 미디어 크리에이터는 이 멀티모달 생성을 한 직원 안에 모아 둔 역할입니다. 스튜디오의 크리에이티브 디렉터처럼, 무엇을 만들지 정하고 알맞은 도구를 골라 호출합니다.
스킬은 10종입니다. Higgsfield 계열(media-higgsfield-*)은 이미지·영상 생성을, 오디오 계열(media-audio-gen)은 ElevenLabs 음성 생성을, 프롬프트 빌더 계열(media-gpt-image-2 / media-gemini-3 / media-midjourney-v8 / media-codex-image)은 각 모델에 맞춘 완성 프롬프트를 만들어 줍니다. v6.2.0에서 마케터로부터 미디어 생성 도메인이 분리되어 신설되었습니다. Higgsfield·ElevenLabs MCP가 연동됩니다.
브랜드 톤과 시각 일관성이 중요한 작업인 만큼, 산출물이 브랜드에 맞는지 검수하는 직원이 붙어 있습니다.
flowchart LR
A["요청
(제품 숏 영상 만들어줘)"] --> B["스킬 매칭"]
B --> C["media-producer
이미지·영상·오디오 생성"]
C --> D["media-brand-auditor
브랜드 정합 검수"]
D --> E["산출물
(이미지·영상·음성)"]media-* 계열 생성 스킬의 전체 목록입니다.
스킬 10종 — 아래 표는 마켓플레이스 정본(v6.2.0)에서 자동 생성됩니다.
| 스킬 | 무엇을 해주나 |
|---|---|
media-asset-production | | (별칭) media-asset-production 스킬은 두 개의 스킬로 분리되었습니다. 콘텐츠 발행 일정·캘린더는 moai-marketer:content-editorial-calendar 를, 유튜브·팟캐스트 에피소드 기획은 moai-marketer:marketing-youtube-podcast-planner 를 사 |
media-audio-gen | | 통합 오디오 생성 스킬. ElevenLabs MCP 기반 TTS(32개국어), 보이스 클로닝(1분 샘플), 다국어 더빙(립싱크), 효과음 생성을 지원. "목소리 생성", "TTS", "음성 합성", "보이스 클로닝", "더빙", "나레이션", "효과음", "AI 음성" 요청 시 사용. |
media-codex-image | | codex CLI의 내장 image_gen 도구로 **gpt-image-2** 이미지를 생성합니다 — ChatGPT OAuth 인증으로 **API 키 불필요**, ChatGPT Plus/Team/Enterprise 구독 한도로 동작합니다. 다음과 같은 요청 시 사용하세요: - "codex로 이미지 만들어줘", "cod |
media-gemini-3-image-prompt | | Google Gemini 3 Pro Image (a.k.a. Nano Banana Pro) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Google AI Developers 공식 가이드의 5-component 구조([Subject+Adj] do |
media-gpt-image-2-prompt | | OpenAI GPT-image-2 모델 전용 이미지 프롬프트 텍스트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정 라운드로 컨텍스트를 수집하고, OpenAI Cookbook 공식 6-Block 구조(Subject·Action·Scene·Composition·Lighting·Style&Te |
media-higgsfield-core | | Higgsfield MCP 이미지·영상 생성의 공유 코어. media-higgsfield-image / media-higgsfield-video가 로드하는 SSOT(single source of truth)로, 호출 스키마·라이브 카탈로그 조회 프로토콜·공통 크래프트 규칙(R1–R5)·인터뷰 슬롯·잡 수명주기를 정의합 |
media-higgsfield-image | | Higgsfield MCP 기반 AI 이미지를 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield로 이미지 만들어 줘" - "Sou |
media-higgsfield-video | | Higgsfield MCP 기반 AI 영상을 자연어 요청 한 줄로 생성합니다. 모델·파라미터를 하드코딩하지 않고 라이브 카탈로그(models_explore)를 조회해 호출하므로, 카탈로그가 바뀌어도 드리프트 없이 동작합니다. 다음과 같은 요청 시 사용하세요: - "Higgsfield 영상 만들어줘" - "Veo로 영상 |
media-midjourney-v8-prompt | | Midjourney v8.1 (2026.03 Alpha) 전용 이미지 프롬프트 빌더. 사용자 자연어 한 줄 + AskUserQuestion 프리셋·미세조정으로 컨텍스트를 수집해 Midjourney 공식 Parameter List 기반 키워드+`--파라미터` 형식으로 변환합니다. Discord `/imagine` 또는 |
media-notebooklm-slide-prompt | | 강연·강의·세미나 본문 마크다운을 입력받아 (1) NotebookLM Studio에 그대로 붙여 넣을 슬라이드 데크 생성 프롬프트와 (2) 슬라이드별 나노바나나(Gemini 3 Pro Image, a.k.a. Nano Banana Pro) 5-Component 이미지 프롬프트를 동시 산출하는 prompt-builder |
media-producer(실행 직원)가 이미지·영상·오디오를 생성하고, media-brand-auditor(검수 직원)가 산출물이 브랜드 톤·일관성 기준에 맞는지 검수합니다.
| 에이전트 | 역할 | 유형 |
|---|---|---|
media-brand-auditor | Read-only skeptical auditor for the moai-media plugin. Use to independently evaluate image, video, and audio assets plus generation prompts produced by media-producer or media-* skills. Checks brand/s | 검수 (읽기 전용) |
media-producer | Multimodal media generation producer for the moai-media plugin. Use when the user asks to generate images, video, or audio — an Higgsfield image/video, an ElevenLabs TTS/voice-clone/dub, or a build pr | 실행 (worker) |
1. Higgsfield 시네마틱 숏. “이 제품 15초 시네마틱 숏으로 만들어줘"라고 하면 media-higgsfield-video가 Higgsfield MCP로 영상을 생성합니다. 사전에 예상 크레딧을 고지합니다.
2. 이미지 프롬프트 빌드. “이 캠페인 키비주얼을 GPT-image와 Midjourney용 프롬프트로 뽑아줘"라고 하면 media-gpt-image-2-prompt·media-midjourney-v8-prompt가 각 모델에 맞춘 완성 프롬프트를 제공합니다.
3. 음성 광고 제작. “20초 음성 광고 스크립트 음성으로 만들어줘"라고 하면 media-audio-gen이 ElevenLabs로 음성을 생성합니다.
잘 안 될 때 — Higgsfield 생성 실패 시 프롬프트 온리 폴백으로 전환합니다. OAuth 인증은 Higgsfield MCP 설정을 참고하세요.
- higgsfield — 이미지·영상 생성. Higgsfield OAuth 인증이 필요합니다 (설정 가이드).
- ElevenLabs — 텍스트 음성 변환·보이스 클로닝. ElevenLabs API 키가 필요합니다.