2025년 3월 28일 금요일

오픈 마누스(manus) AI 에이전트 설치, 사용 및 구조 분석하기

한동안 회사 일 때문에 미뤄두었던, 딥시크(DeekSeek)와 더불어 많이 많은 마누스(manus.im)에서 영감받아 개발된 오픈마누스(open manus) 오픈소스 AI 에이전트를 설치, 사용 및 분석한다. 오픈마누스는 MetaGPT란 이름으로 활동 중인 중국인 개발자가 공개한 AI에이전트이다. 개발자는 오픈마누스가 연결된 다양한 도구들을 LLM으로 조율하고, 실행할 수 있고 주장하고 있다. 깃허브 등에 설명된 오픈 마누스는 다음과 같은 기능을 지원한다.
  • 로컬에서 AI 에이전트 실행
  • 여러 도구 및 API 통합: 외부 API, 로컬 모델 및 자동화 도구를 연결, 호출
  • 워크플로우 사용자 지정: AI가 복잡한 다단계 상호 작용을 효율적으로 처리
  • 여러 LLM 지원: LLaMA, Mistral 및 Mixtral과 같은 인기 있는 개방형 모델 모델과 호환
  • 자동화 향상: 내장 메모리 및 계획 기능을 통해 OpenManus는 코딩, 문서 처리, 연구 등을 지원
다음 그림은 이 에이전트가 지원하는 기능 중 일부이다. 
prompt: Create a basic Three.js endless runner game with a cube as the player and procedurally generated obstacles. Make sure to run it only in browser. If possible also launch it in the browser automatically after creating the game.

오픈 마누스는 이전 중국에서 개발된 마누스의 관심을 오픈소소로 옮겨지는 데 성공했다. 오픈 마누스는 현재 github에서 40.6k란 매우 높은 좋아요 관심을 받고 있다. 
오픈 마누스(현재 시점. 40.6k stars)

개인적으로 오픈마누스에 대한 관심도가 높았던 것은, 구현된 기술보다는 에이전트 분야에서 크게 알려진 마누스에 대한 관심, 오픈소스 버전의 AI에이전트 코드 공개가 더 크게 작용했다고 생각한다. 이제 설치 사용해 보고, 성능 품질을 확인해 보자. 그리고, 코드 실행 메커니즘을 분석해 본다. 

참고로, Google의 에이전트 백서에 보면, 생성형 AI 에이전트는 목표 달성을 위해 세상을 관찰하고 스스로 행동하는 자율적인 애플리케이션으로 설명된다. 명시적인 지시가 없어도 스스로 판단하고 능동적으로 목표에 접근할 수 있다. 이러한 에이전트는 행동과 의사결정을 위한 인지 아키텍처를 갖추며, 핵심 구성 요소는 다음 그림과 같이 사용자 입력에 대한 추론 역할을 하는 모델(보통, 혰와 같은 LLM), 입력에 대해 필요한 기능들을 제공하는 도구(Tools), 그리고, 어떤 도구들을 호출할지 조율하는 오케스트레이션 이 세 가지로 이루어진다.

AI 에이전트 구성요소(Agents, Google, 2024)

이 글에서 이런 메커니즘이 어떻게 구현될 수 있는 지를 오픈마누스란 재료를 통해 고민해 보는 시간을 가져보자. 

오픈마누스 설치
개발환경은 이미 컴퓨터에 NVIDIA, CUDA, PyTorch 등이 설치되어 있다고 가정한다. 이제, 다음 명령을 터미널에서 실행해 설치한다.
conda create -n open_manus python=3.12
conda activate open_manus
cd OpenManus
pip install -r requirements.txt
playwright install

오픈마누스가 설치하는 패키지를 보면, 많은 경우, 기존에 잘 만들어진 LLM, AI Agent 라이브러리를 사용하는 것을 알 수 있다. 여기서 사용하는 주요 라이브러리는 다음과 같다.

pydantic, openai, fastapi, tiktoken, html2text, unicorn, googlesearch-python, playwright, docker

config/config.toml 설정 파일을 수정한다. api_key에 OpenAI의 API 키 등을 입력한다(만약, API 키 유출 등이 불안하다면, Ollama 오픈소스 LLM 모델로 설정한다).
# Global LLM configuration
[llm]
model = "gpt-4o"
base_url = "https://api.openai.com/v1"
api_key = "sk-..."  # Replace with your actual API key
max_tokens = 4096
temperature = 0.0

# Optional configuration for specific LLM models
[llm.vision]
model = "gpt-4o"
base_url = "https://api.openai.com/v1"
api_key = "sk-..."  # Replace with your actual API key

실행
일단, 예제를 간단히 실행해 본다. 
python main.py

적절한 프롬프트를 입력해 본다. 
create PDF file about BIM(building information modeling). 

마누스는 이 프롬프트에 응답해, LLM에 입력하여, 마누스에 등록된 도구를 호출하는 정보와 스크립트를 생성한다. 그리고, 이를 통해 각 도구들을 적절히 호출해 실행한다.

다음은 각 프롬트에 대한 그 예를 보여준다. 
prompt: Create a basic Three.js endless runner game with a cube as the player and procedurally generated obstacles. Make sure to run it only in browser. If possible also launch it in the browser automatically after creating the game.
prompt: I need a 7-day Japan itinerary for April 15-23 from Seattle, with a $2500-5000 budget for my fiancée and me. We love historical sites, hidden gems, and Japanese culture (kendo, tea ceremonies, Zen meditation). We want to see Nara's deer and explore cities on foot. I plan to propose during this trip and need a special location recommendation. Please provide a detailed itinerary and a simple HTML travel handbook with maps, attraction descriptions, essential Japanese phrases, and travel tips we can reference throughout our journey.
prompt: create PDF file about ConTech in construction

실행결과는 많이 알려진 프롬프트를 제외하고는 그다지 품질이 좋지는 않다. 그럼에도, 나름 많은 스타를 깃허브에서 얻고 있는 오픈 마누스의 에이전트의 구조를 분석하는 것은 의미가 있어 보여, 좀 더 자세히 코드를 확인해 본다.

코드 동적 구조 분석
동적 구조는 실행 흐름을 타고 가며 확인한다. 참고로, 이 구조는 다음 프롬프트일때 실행되는 구조이다. 
I need a 7-day Japan itinerary for April 15-23 from Seattle, with a $2500-5000 budget for my fiancée and me. We love historical sites, hidden gems, and Japanese culture (kendo, tea ceremonies, Zen meditation). We want to see Nara's deer and explore cities on foot. I plan to propose during this trip and need a special location recommendation. Please provide a detailed itinerary and a simple HTML travel handbook with maps, attraction descriptions, essential Japanese phrases, and travel tips we can reference throughout our journey.

프롬프트는 일본 여행 기간을 명시하고 7일간 일정이 필요하다 말하고 있다. 

이에 대한 마누스 에이전트의 전체 큰 실행 구조는 다음과 같다.
  1. call main() # 메인 호출
  2. prompt = input() # 프롬프트 입력
  3. Manus.BaseAgent.run(prompt) # 프롬프트 입력에 따른 에이전트 도구들 실행
    1. update_memory() # 과거 입출력 저장
    2. max_steps 만큼 아래 루프 반복 # default max_steps = 20
    3. step_result = ReActAgent.step()  # 에이전트 도구 단계별 실행
      1. should_act = think() # 무슨 도구를 순서대로 호출할 지 LLM통해 정보얻음
        1. recent_messages = memory.messages[-3:]
        2. Manus.BrowserAgent.ToolCallAgent.think()  # 도구 선택 추론
          1. extract current browser page information  # 웹화면 정보 사용
          2. response = LLM.ask_tool()  # 추론 시 LLM 사용 
            1. check token limit  # 토큰 한계 체크
            2. response = ChatCompletion(params)  # LLM 호출
            3. return response[0].message  # 결과 리턴
          3. return response
      2. act()  # 에이전트 도구가 선택되었으니, 이를 실행
        1. tool_callls 에 담긴 도구 호출 명령에 따른 도구들 실행 루프 수행
          1. ToolCallAgent.execute_tool(command)  # 도구 실행
            1. args = json.loads(command) # 예. web_search. '7-day tour'
            2. ToolCollection.execute(args)  # 도구집합에서 해당도구실행
              1. BrowserUseTool.execute(args) # 쿼리검색 후 link 리턴
                1. _ensure_browser_initialized()  #브라우저 초기화
                2. links = WebSearch.execute(args.query) # 웹서치
                3. page = get_current_page()  # 페이지정보
                4. result = page.goto(url_to_navigate)  
                5. return ToolResult(args, result) # 검색결과 수집
            3. return observation(result)
          2. tool_msg = 도구 실행 명령 및 함수 정보
          3. memory.add_message(tool_msg)  # 메모리 업데이트
          4. results.append(result)
      3. return results  # 결과리턴
이를 좀 더 알기 쉽게 표현하면 다음같이 설명될 수 있다. 

1. 프로그램 시작: 메인 함수 호출
2. 프롬프트 입력: 사용자로부터 프롬프트 입력
3. 에이전트 실행: BaseAgent가 입력을 기반으로 동작 시작
4. 메모리 업데이트: 과거 입력/출력 내용을 memory에 저장
5. 에이전트 루프 실행 (기본 max_steps = 20)
    5.1. 단계 실행 (Step): ReActAgent가 현재 단계 처리 시작
    5.2. 다음 행동 판단 (Think)
        5.2.1. 최근 메시지 3개 불러오기
        5.2.2. LLM을 통해 다음 행동(도구 호출 여부 등) 추론
    5.3. Think: 도구 선택 판단
        5.3.1. BrowserAgent가 어떤 도구를 쓸지 결정
        5.3.2. 현재 브라우저 페이지 정보 추출
        5.3.3. 필요 시 LLM에 도구 사용 목적 질의 (ask_tool)
        5.3.4. 토큰 한계 체크
    5.4. LLM 호출 및 응답
        5.4.1. ChatCompletion으로 명령 생성
        5.4.2. 생성된 메시지 반환
    5.5. Act: 도구 실행 (Act)
        5.5.1. 도구 호출 명령(command)을 파싱 (예: JSON)
        반복 (모든 명령에 대한 도구 실행):
            5.5.2. 도구 실행 수행
                5.5.2.1. ToolCollection에서 해당 도구 실행
                5.5.2.2. 브라우저 초기화 (_ensure_browser_initialized)
                5.5.2.3. 웹 검색 수행 (WebSearch.execute)
                5.5.2.4. 페이지 이동 및 정보 추출 (page.goto)
            5.5.3. 도구 결과 처리
                5.5.3.1. ToolResult로 실행 결과 정리
                5.5.3.2. observation 형태로 결과 정리
    5.6. 메모리 및 결과 저장
        5.6.1. 도구 실행 정보 및 결과를 memory에 저장
        5.6.2. 결과 리스트에 추가
6. 최종 결과 반환: 누적된 결과 또는 마지막 응답을 사용자에게 반환

이 중에 핵심 실행 단계만 확인해 보자. 

5번 단계의 think는 LLM을 이용해 사용자 프롬프트를 기반으로 다음과 같이 적절한 도구를 순서대로 선택하도록 명령하고 있다. 이런 이유로, 도구에 대한 프로토타입을 LLM 호출 시 컨텐츠로 전달해 두어야 한다.
"Based on user needs, proactively select the most appropriate tool or combination of tools. For complex tasks, you can break down the problem and use different tools step by step to solve it. After using each tool, clearly explain the execution results and suggest the next steps."
think() 함수 동작 방식(일부)

현재 마누스 버전에서 프롬프트 템플릿은 다음처럼 정의되어 있다.
   
SYSTEM_PROMPT = (
    "You are OpenManus, an all-capable AI assistant, aimed at solving any task presented by the user. You have various tools at your disposal that you can call upon to efficiently complete complex requests. Whether it's programming, information retrieval, file processing, or web browsing, you can handle it all."
    "The initial directory is: {directory}"
)

NEXT_STEP_PROMPT = """
Based on user needs, proactively select the most appropriate tool or combination of tools. For complex tasks, you can break down the problem and use different tools step by step to solve it. After using each tool, clearly explain the execution results and suggest the next steps.
"""

LLM을 호출하는 부분은 위 템플릿을 이용해 시스템 프롬프트와 함께 사용자 질의를 입력하는 부분으로 구성될 것이다. 다음은 해당 정보를 보여준다. 
prompt: create input.txt file and copy it to output.txt

본인의 경우, gpt-4o LLM 을 사용했다. messages의 1번에는 사용자 프롬프트가 입력되어 있고, 이 목표를 달성하기 위해 적절한 도구를 선택하라 명령하고 있다. tools에 함수 프로토타입이 저장된 것을 확인할 수 있다. 이를 근거로, LLM은 목표를 달성하기 위한 적절한 함수 호출 시퀀스를 생성한다.

브라우저 화면의 검색 정보가 직접 필요한 경우가 있다. playwright를 이용해 해당 정보를 얻는 부분이 think()에서 사용되는 경우도 있을 수 있다. 다음 그림은 사용자 프롬프트 질의에 따라 LLM 이 선택한 도구인 브라우저를 통해 정보를 얻고, 그 정보를 메모리에 업데이트하면서, 에이전트 도구를 실행해 가는 화면이다. 
에이전트 검색 결과
에이전트 도구의 리턴 결과(일부)

결론적으로 핵심만 요약해 보면, 다음과 같은 방식으로 에이전트가 실행되는 것을 확인 할 수 있다. 
  1. 사용자 프롬프트 입력
  2. LLM 이 프롬프트를 통해 어떤 에이전트 도구들을 실행할 지 결정. 도구 정보 반환
  3. 도구 호출 정보에 따라, 현재 등록된 도구들을 호출. 결과 파일은 workspace에 저장
  4. 도구 호출 결과는 메모리에 저장. 이는 LLM 이 도구를 호출할 때 참고 컨텐츠로 재사용
  5. 사용자 프롬프트 요구사항(목표)을 만족할 때까지 앞의 내용 반복
다음은 각 step별로 에이전트가 호출되어 파일이 생성될 경우 저장된 workspace 폴더와 예시를 보여주다. 
AI 에이전트 도구에 의해 생성된 파일(우: 게임 코드, 좌하: 일본여행일정)

분석해 보면, 사실, 대단한 메커니즘은 아니다. 이는 기존 OpenAI LLM 플랫폼 도구, LangChain과 같은 RAG, Ollama 같은 LLM Agent 도구에도 있었던 것이다. 좀 다른 것은 다음과 같은 기능이 기본으로 구현되어 있다는 정도로 보이는 데, 이도 다른 유명 LLM, 에이전트 플랫폼에서 하고 있는 것이라 큰 차이라 보기가 어렵다.  
1. 웹브라우저를 통해 인터넷 컨텐츠 정보로 적극 사용한 것. 화면 자체에서 정보를 얻는 기능
2. 파일 및 폴더, MCP(Model Control Procotol), 파이썬, 터미널 조작 등 지원

오픈마누스의 가장 큰 장점은 오픈소스로 누구나 그 메커니즘을 확인하고, 분석하는 재미와 기여하며 커가는 커뮤니티 연대 정도로 생각할 수 있겠다. 

코드 정적 구조 분석
코드 정적 구조 분석을 위해 폴더부터 분석해 본다. 구조는 다음과 같다.
OpenManus/
├── app/                      # 애플리케이션 핵심 코드
│   ├── agent/              # 에이전트 로직 (예: BaseAgent, ReActAgent)
│   ├── flow/                # 실행 흐름 제어 (workflow, step control)
│   ├── mcp/                # Model Control Procotol
│   ├── prompt/            # 프롬프트 템플릿 관련
│   ├── sandbox/           # 실행 격리 환경 (보호된 실행 공간)
│   └── tool/                 # 실행 가능한 다양한 도구 모음
│       ├── bash.py                  # Bash 명령 도구
│       ├── browser_use_tool.py  # 브라우저 연동 도구
│       ├── create_chat_completion.py # LLM 호출 지원
│       ├── file_operators.py       # 파일 입출력 도구
│       ├── file_saver.py             # 파일 저장 도구
│       ├── mcp.py                   # 제어 관련 도구
│       ├── planning.py             # 계획 생성 도구
│       ├── python_execute.py    # 파이썬 코드 실행 도구
│       ├── str_replace_editor.py  # 문자열 편집 도구
│       ├── terminal.py              # 터미널 명령 실행 도구
│       ├── terminate.py            # 실행 종료 도구
│       ├── tool_collection.py      # 전체 도구 관리자
│       └── web_search.py          # 웹 검색 도구
├── assets/                  # 에셋, 리소스 파일
├── config/                  # 설정 파일들
├── examples/              # 예시 실행 계획들
│   └── japan-travel-plan/  # 예: 여행 계획 샘플
├── logs/                     # 실행 로그 저장
├── tests/                    # 테스트 코드
│   └── sandbox/         # 샌드박스 테스트
└── workspace/             # 임시 실행 또는 작업 파일 저장소

설치된 폴더 구조 (일부)

각 코드를 정적 분석해, 핵심 클래스만 UML로 분석해 보겠다. 마누스의 주요 클래스 구조는 다음과 같다. 
오픈 마누스 클래스 다이어그램(UML)

소프트웨어 공학적으로는 디자인패턴strategy pattern (ToolCollection, BaseTool) 을 사용하고 있다. 나머진 일반적인 OOAD 구조이다.

BaseTool 클래스는 execute 메서드를 공통으로 가지며, 이를 상속한 각 도구 클래스들(Terminal, FileSaver, MCPClientTool, WebSearch, DomService, BrowserUseTool 등)은 시스템 명령 실행, 파일 저장, 브라우저 제어 등 특정 기능을 담당한다. 각 도구는 ToolCollection에 집합되어 있으며, tool_map을 통해 관리되고 execute를 통해 실행된다.

ToolCallAgent는 think 메서드를 통해 어떤 도구를 사용할지 판단하고, 판단 결과를 ToolCollection에 전달하여 해당 도구를 실행한다. ReActAgent는 step, think, act 메서드를 통해 LLM 기반 추론과 도구 실행 흐름을 단계적으로 처리하며, BaseAgent는 이를 상속받아 step 단위의 실행 흐름을 제공한다. Manus 객체는 최상위 제어자로서 전체적인 에이전트의 동작을 통제하며 think 메서드를 통해 추론을 담당한다. BrowserAgent는 BrowserUseTool과 관련된 think 역할을 수행한다.

BrowserUseTool은 WebSearch와 DomService를 포함하며 웹 페이지 탐색, 클릭, 입력 등의 브라우저 상의 조작을 담당한다. DomService는 클릭, 스크롤, 탭 전환 등 구체적인 DOM 제어 명령을 담당하며, 오른쪽 enum 박스는 이 DomService가 수행할 수 있는 구체적인 명령어 목록을 나열한 것이다.

LLM 클래스는 ask_tool, ask_with_images, ask 등의 메서드를 제공하며, 도구 선택 판단 또는 일반 자연어 추론을 위한 언어 모델 호출 기능을 수행한다. LLM이 사용하는 모델은 gpt-4-vision, gpt-4.0, claude-3 계열 등으로 구성된 멀티모달 모델 리스트에 명시되어 있다.

전체 구조는 에이전트가 사용자 입력을 받아 LLM을 통해 판단하고, 적절한 도구를 선택하여 실행하며, 이를 반복적으로 수행하는 다단계 추론 및 실행 체계를 중심으로 구성되어 있다.

마무리
이 글을 통해 오픈마누스를 분석해 보았다. 개발 시작한 지 얼마 안되는 따끈따끈한 코드라서 그런지, 아직 코드 리팩토링이 잘 안되어 있고, 구조도 멀티 에이전트라 하기에는 좀 부족하고 확장성에 문제가 있는 것들이 있다. 에이전트 선택 및 호출하는 부분은 막코딩(?) 같은 부분이 있어 구조적으로 깔끔하지 못하다. LangChain처럼 많은 개발자가 참여하면 크게 복잡해져 입력-결과를 예측하기 어려워지거나, 버전업에 되면서 빅스텝(과거와의 단절)이 될 수 있을 것 같다. 

에이전트의 핵심기술은 결국 추론 능력을 가진 LLM을 어떻게 잘 활용하는 가이다. 이런 점에서 마누스(최근 해킹되어 코드 확인해 보았더니)나 오픈마누스는 기존 LLM과 프롬프트 템플릿을 복잡하게 wrapping 해 놓은 모듈이란 말이 나올 수 밖에 없다.

좀 더 깃허브를 살펴보니, 이를 주도하는 개발자는 심천에 있는 중국인이며. 이외, 지장에 있는 개발자, 학생들 6명 정도가 주축으로 개발하고 있는 것 같다(소프트웨어 공학적으로는 약간 아마추어 느낌). RL 모듈은 UIUC에 다니는 중국인 대학원생, 홍콩과기대 학생 등이 주축이되고 있다(참 열심히 개발하는 느낌).
오픈 마누스 개발 공헌자

그럼에도 불구하고, 이들이 열심히 개발 중인 오픈소스 구조를 살펴보고 여러 구현 아이디어를 보는 것은 즐거운 것이다. 스스로 본인이 개발하는 코드를 공개하고, 고민을 공유하는 것은 브랭딩 전략이란 점을 제외하더라도 오픈소스 커뮤니티에 공헌하는 의미있는 행위라 생각한다.

레퍼런스

2025년 3월 24일 월요일

기술로 감동을 주는 선배들

이 글은 기술로 감동을 주는 선배들에 대한 기록이다. 

나는 개발자며 작가이자 공학 오타쿠이며, 외적으로는 회사 안과 밖의 여러 직책을 가진 연구자이다. 내가 내적, 외적으로 나를 분리해 보는 습관은 괘 오래 된 것이다. 한국 연구 생태계에서는 이것이 Identify와 Brand를 지키는 쉽지 않은 몇 안되는 방법이다. 개인적으로 매우 많은 시도를 해 보았으나, 현실을 파악한 상황에서는 남은 나의 인생과 시간을 아끼며 의미있는 삶과 브랜딩을 위해 전략적으로 살아가기로 한지 오래다. 

가끔, 내적 활동 중 연구를 하다 보면, 정말 감탄하게 되는 분들을 만나게 된다. 예를 들면, 내가 먹고 사는 분야 중 하나인 CAD에서는 이건우 교수님 같은 분이고, BIM에서는 이스트만 교수님, VDC 마틴피셔 교수님, 토목의 밀러 교수님 같은 분들이다. 내가 공학의 내적 세계에서 우상으로 있는 분들은 이외 소프트웨어 공학, 컴퓨터 그래픽스 분야에도 우뚝 서 있다. 

이 분들의 유산은 아낌없이 주는 나무처럼 기술적으로 나를 감동시킨다. 순수한 호기심과 열정으로 세상에 없던 것을 만들어 내는 것은 어느 평범한 누구와 같이 단기적 이익을 쫓는 정치하는 사람과는 비교할 수 없는 위치의 수준을 보게 된다. 이런 이유로 나는 책을 쓸때마다 나에게 영감을 준 이 분들의 이름을 먼저 언급하고 마음 깊이 감사함을 항상 표한다. 

어차피 사람은 언젠가 모두 죽게 되어 있다. 과학과 공학 분야에서 어떤 사람을 메모리얼하고 그리워하는 것은 그 분의 유산이 감동적이었기 때문이라 생각한다.

다음은 나에게 기술적 감동을 준 분들 중 일부 기록을 남긴다.
레퍼런스

2025년 3월 1일 토요일

최근 포인트 클라우드 세그먼테이션 동향

이 글은 최근 포인트 클라우드 세그먼테이션 동향에 관한 연구를 간략히 조사한것이다.


레퍼런스

2025년 2월 15일 토요일

대형언어모델 Gemma2 파인튜닝하기

대형 언어 모델(LLM)인 Gemma2-2B를 미세 조정하면 특정 작업에 대한 성능을 크게 향상시킬 수 있다. 이 가이드는 Google Colab을 활용하여 Gemma2-2B를 미세 조정하는 과정을 단계별로 설명한다.  

사전 준비 사항  
미세 조정을 진행하기 위해 다음과 같은 준비가 필요하다.  
- Google Colab(https://colab.research.google.com/) 계정이 있어야 한다. 혹은, NVIDIA GPU 환경(24GB 이상)이 구축된 컴퓨터가 있어야 한다.
- Python 및 머신러닝 기초 개념을 이해하고 있어야 한다.  

1단계: 환경 설정  
1. Google Colab 접속  
   - Google Colab(https://colab.research.google.com/)에 접속하여 새 노트북을 생성한다.  
2. GPU 설정  
   - 상단 메뉴에서 `편집(Edit) > 노트북 설정(Notebook settings)`으로 이동하여 하드웨어 가속기를 `GPU`로 변경한다.  
3. 필요한 패키지 설치  
   - 아래 명령어를 실행하여 필수 라이브러리를 설치한다.  
   !pip install transformers datasets accelerate

2단계: Gemma2-2B 모델 불러오기  
Hugging Face의 `transformers` 라이브러리를 사용하여 사전 학습된 Gemma2-2B 모델을 로드한다.  
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "google/gemma2-2b"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(model_name)

3단계: 데이터셋 준비  
미세 조정을 위해 작업에 맞는 데이터셋이 필요하다. Hugging Face의 `datasets` 라이브러리를 사용하여 데이터를 로드하고 토큰화할 수 있다.  
from datasets import load_dataset
# 'your_dataset'을 원하는 데이터셋 이름 또는 경로로 변경해야 한다. 데이터셋 예시: lavita/ChatDoctor-HealthCareMagic-100k · Datasets at Hugging Face
dataset = load_dataset('your_dataset')
# 토큰화 함수 정의
def tokenize_function(examples):
    return tokenizer(examples['text'], padding="max_length", truncation=True)
# 데이터셋 토큰화 적용
tokenized_dataset = dataset.map(tokenize_function, batched=True)

4단계: 모델 미세 조정  
데이터셋을 준비한 후, 아래 코드로 모델을 미세 조정할 수 있다.  
from transformers import TrainingArguments, Trainer
training_args = TrainingArguments(
    output_dir="./results",
    evaluation_strategy="epoch",
    learning_rate=2e-5,
    per_device_train_batch_size=4,
    per_device_eval_batch_size=4,
    num_train_epochs=3,
    weight_decay=0.01,
)
trainer = Trainer(
    model=model,
    args=training_args,
    train_dataset=tokenized_dataset["train"],
    eval_dataset=tokenized_dataset["validation"],
)
trainer.train()

5단계: 미세 조정된 모델 저장  
학습이 완료된 모델을 저장하여 향후 사용할 수 있도록 한다.  
model.save_pretrained("./fine_tuned_gemma2_2b")
tokenizer.save_pretrained("./fine_tuned_gemma2_2b")

결론  
이 가이드를 따르면 Google Colab에서 Gemma2-2B 모델을 미세 조정하여 특정 작업에 최적화된 모델을 만들 수 있다. 미세 조정을 통해 모델의 성능을 향상시키고 특정 도메인 문제를 해결하는 데 도움을 줄 수 있다.  

참고 
대형 모델의 미세 조정은 많은 GPU 리소스(최소 24GB 이상)를 필요로 한다. Google Colab Pro 또는 TPU를 활용하면 더 원활한 학습이 가능하다. 

2025년 1월 26일 일요일

생성AI, LLM, AI Agent와 그래픽, 디자인, 미디어아트 관련 자료 소개

이 글은 생성AI, LLM, AI Agent와 그래픽, 디자인, 미디어아트에 관한 자료를 정리한 것이다. 관련 도구 및 예제는 다음 링크에 자세히 설명하였으니 참고한다.
프롬프트에서 생성된 그래픽스 예시

Blender LLM 기반 그래픽 모델링 관련 자료
LLM, ollama, Blender python library 등을 이용하면, 프롬프트를 입력해, 3차원 모델을 자동 생성할 수 있다. 다음은 관련 예시를 보여준다. 
Prompt: Create 100 cubes. The y position of each cube follows the cosine function along the x-axis with random color.

이를 이용해 다음과 같은 GPT 에이전트가 구현된다. 

상세한 동작 메커니즘은 다음 링크를 참고한다.

LLM과 컴퓨터 그래픽스
앞에서 사용한 방법과 동일하게, OpenGL, processing.org 등 3차원 가시화 도구를 이용해 실시간으로 프롬프트를 통해 컴퓨터 그래픽스 장면을 생성할 수 있다. 다음은 프롬프트를 통해 생성된 그래픽스를 보여준다. 

데이터 기반 그래픽스 렌더링 예시

생성된 그래픽스 코드는 다음과 같다. 
from p5 import *
import pandas as pd

# Load the dataset
data = pd.read_csv('input.csv')

def setup():
  size(720, 400)
  no_stroke()

def draw_cone(size_x, size_y, position):
  with push_matrix():
    translate(*position)
    cone(size_x, size_y)

def draw():
  background(20, 100, 24)
  lights()
  rotate_x(frame_count * 0.01)
  # rotate_y(frame_count * 0.01)
  blinn_phong_material()

  interval = 200
  for i, row in data.iterrows():
    x = (i % 3) * interval - interval
    y = 0
    z = (i // 3) * interval - interval
    draw_cone(row['energy'], row['temperature'], (x, y, z))

  locX = mouse_x - width/2
  locY = mouse_y - height/2
  light_specular(0, 0, 255)
  point_light(360, 360*1.5, 360, locX, locY, 400)

if __name__ == '__main__':
  run(mode='P3D')

LLM과 사운드 엔지니어링
동일한 원리로 사운드를 개발할 수 있다. 다음은 LLM을 통해 생성된 사운드 코드를 실행한 결과이다. 
사운드 생성 예

생성된 코드는 다음과 같다.
from psonic import *
import time
from threading import Thread, Condition

set_server_parameter_from_log("127.0.0.1")

def play_mozart(condition):
  while True:
    with condition:
      condition.notifyAll() # Message to threads      

    beat = 0.33

    melody = [
      E5, E5, F5, G5, G5, F5, E5, D5, C5, C5, D5, E5, E5, D5, D5,
      E5, E5, F5, G5, G5, F5, E5, D5, C5, C5, D5, E5, D5, C5, C5
    ]

    # Drum beat pattern
    def play_beat():
      sample(DRUM_HEAVY_KICK, amp=1.5)  # Strong kick drum
      sample(ELEC_CHIME, amp=1.2)  # Electric guitar sample
      sample(BD_ZOME, amp=1.5)
      sleep(beat / 2)

      sample(DRUM_CYMBAL_CLOSED, amp=1.2)  # Closed cymbal
      sample(ELEC_CHIME, amp=0.6)  
      sample(BD_ZOME, amp=0.6)
      sleep(beat / 2)

      sample(DRUM_SNARE_HARD, amp=1.3)  # Strong snare
      sample(ELEC_CHIME, amp=1.2)   
      sample(BD_ZOME, amp=1.3)
      sleep(beat / 2)
      
      sample(DRUM_CYMBAL_CLOSED, amp=1.2)
      sample(ELEC_CHIME, amp=0.6)  
      sample(BD_ZOME, amp=0.6)
      sleep(beat / 2)

    # Melody, Beat Channel Play 
    for note in melody:
      play(note, amp=1.0) # , release=0.2)  # Melody
      play_beat()  # Beat Pattern


condition = Condition()
mozart_thread = Thread(name='producer', target=play_mozart, args=(condition,))
mozart_thread.start()

input("Press Enter to continue...")

LLM과 피지컬 컴퓨팅
피지컬 컴퓨팅에 많이 사용되는 아두이노 등을 이용해, 프롬프트로 명령을 주면, 임베딩 컴퓨터가 명령을 실행할 수 있는 코드를 LLM이 생성해, 모터, 조명과 같은 액추에이터를 동작시킬 수 있다. 다음은 그 예를 보여준다. 

참고로, 아두이노의 경우, .ino 코드 파일을 실시간으로 컴파일해 아두이노보드로 전송하는 cli 도구가 설치 시 포함되어 있다. 이를 이용해, 컴파일 에이전트를 구현할 수 있다. 
Arduino CLI 도구

Ollama와 오픈소스 LLM 이용한 건축 이미지 프롬프트 역공학
말이 어렵지만, 사실 멀티모달을 지원하는 llama3.2-vision과 같은 모델이 저렴하게 공개되고 있는 상황이라, 이를 이용하면 쉽게 프롬프트 키워드 역공학해서, 얻은 프롬프트로 이미지를 생성할 수 있다. 

올라마(ollama) 설치 후 이미지를 준비하고, 다음을 실행한다.
ollama run llama3.2-vision

그리고, image 명령을 이용해 해당 파일 경로를 입력하고 설명하라 한다. 이후, 이 설명을 미드저니 프롬프트 키워드로 변경해 달라 하고, 텍스트-이미지 서비스에 역공학된 프롬프트를 입력하면 된다. 다음은 그 결과이다. 
건축가 자하하디드 스타일 건축물 사진 역공학 후 생성한 이미지 결과(참고)
생성된 영상(KREA)

레퍼런스
이 주제와 관련된 레퍼런스는 다음과 같다.

AI 에이전트
그래픽 모델링
사운드 엔지니어링
피지컬 컴퓨팅

2025년 1월 22일 수요일

CAD 모델 생성AI 및 LLM 기술 조사

이 글은 CAD 모델 생성AI 및 LLM 기술을 조사한다.
SolidGen (Autodesk)

조사를 위해 다음 키워드로 구글링, GITHUB, 논문 검색을 수행한다. 
'CAD', 'Scketch', 'LLM', 'Generative AI', 'Transformers', 'github', 'huggingface'

다음은 검색된 기술 결과를 보여준다. 




레퍼런스