전체 글
-
DyPE: Dynamic Position Extrapolation for Ultra High Resolution Diffusion논문 정리 2026. 1. 8. 15:54
AbstractDiffusion Transformer 모델은 엄청난 fidelity와 detail들을 가진 이미지를 생성해낼 수 있다.하지만 이들을 ultra-high resolution에 학습시키는 것은 이미지 토큰 수에 따라 셀프 어텐션 메커니즘이 2차적으로 확장되기 때문에 ultra-high resolutions을 학습하는 데는 여전히 엄청난 비용이 든다.본 논문에서는 Dynamic Position Extrapolation (DyPE) 알고리즘을 소개한다.이 알고리즘은 training-free이기 때문에, pre-trained diffusion transformer를 자신들이 학습한 데이터 이상의 해상도에 대해 합성할 수 있도록 하면서도, 추가적인 샘플링 비용이 들지 않게 한다.DyPE은 diffu..
-
WorldCraft: Photo-Realistic 3D World Creation and Customization via LLM Agents논문 정리 2026. 1. 7. 17:16
AbstractWorldCraft는 오브젝트로 채워진 실내/외 장면을 절차적으로 생성함에 있어 LLM agent를 활용하는 시스템으로, 사용자가 직관적인 자연어를 사용하여 개별적인 오브젝트의 속성이나 레이아웃을 컨트롤 할 수 있게 한다.프레임워크 안에서는 Coordinator agent가 전반적인 과정을 관리하고, 두 개의 특화된 LLM agents와 scene 생성 업무를 수행한다:ForgeIt은 개별 객체의 정확한 커스터마이징을 가능하게 하기 위하여, auto-verification을 사용해 ever-growing한 manual을 통합하는 에이전트다.ArrangeIt은 ergonomic과 aesthetic의 밸런스를 갖춘 레이아웃에 도달하게 하기 위해, 계층적 최적화 문제를 formulation하는 ..
-
MeshRet: Skinned Motion Retargeting with Dense Geometric Interaction Perception논문 정리 2026. 1. 7. 17:15
AbstractSkinned character에 대한 성공적인 motion retargeting에 있어 서로 다른 신체 부위 사이의 geometric interaction을 포착하고 유지하는 것은 매우 중요한 일이다.기존 방법들은 신체의 geometry를 간과하거나, 모션 리타게팅 이후 geometry 후보정 단계를 추가했다.이는 Skeleton interaction과 geomtry correction 사이 충돌을 야기할 수 있으며, jitter나 interpenetration, contact mismatch 등이 일어날 수 있다.Jitter: 시공간상의 떨림, 불연속성을 의미. Temporal smoothness 혹은 velocity loss 사용Interpenetration: 기하학적인 관통이나 왜곡..
-
HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation논문 정리 2026. 1. 7. 17:14
기존 연구들은 정적인 3D scene에 집중하거나, 오브젝트 단위의 동적 모델링 정도에 집중했다.HoloTime은 이미지/프롬프트로부터 panoramic video 생성을 위해 video diffusion model들을 통합한 프레임워크다.HoloTime은 panoramic video generation과 4D scene reconstruction 모두에서 우월한 성능을 보인다.몰입형 경험에 있어 360 degree field는 굉장히 중요한 영역이다.하지만 아직까지 4D generation에 대한 연구는 데이터의 부족 등으로 많이 진행되지 않았다.HoloTime은 360-degree 4D scene generation framework로, 이전의 문제를 해결하고자 한다.이는 유저가 제공하거나, 모델이 ..
-
OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes논문 정리 2026. 1. 7. 17:12
Abstract3D Scene을 구성하는 방식은 두 가지가 있다: Procedural generation, 2D lifting.이 중에서도 파노라마 기반의 2D lifting은 떠오르는 유망한 기술로, 몰입형이고 실제같으며, 다양한 3D 환경을 생성할 수 있는 파워풀한 2D generative prior를 활용한다.본 연구에서는 PBR, relighting, simulation 기반의 물리에 적합한 graphics-ready 3D scene을 생성하도록 이 기술을 발전시킨다.연구의 주요 인사이트는 geometry, texture, PBR materials에 대한 panoramic perception을 위해 2D generative model을 재활용하는 것이다.이전에 appearance 생성을 강조하고 ..
-
ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies논문 정리 2026. 1. 7. 17:07
Abstract몰입형 VR을 위한 automatic creation of 3D scene은 수 년간 꾸준한 발전을 겪어왔다.이전의 methods는 high-poly mesh modeling과 이에 대한 simplification에 의존하거나, massive 3D gaussians에 의존해왔고, 이로 인해 복잡한 파이프라인이 형성되거나 시각적인 퀄리티가 제한되었다.본 논문에서는 몰입형 경험을 제공하기 위해 그러한 수고가 필요하지 않음을 증명하고자 한다.논문에서 제안하는 ImmerseGen은 새로운 agent-guided framework로, 컴팩트하고 실제같은 world modeling이 가능하다.ImmerseGen은 Scene 자체를 경량화된 geometric proxies로 구성된 계층적 구성으로서 표..
-
AI For Filmmaking: Recognising Shot Types with ResNets개발과 연구 2026. 1. 7. 17:00
블로그 링크AbstractCinematography domain 분석은 고려해야할 요소가 다양하다.Shot scaleShot compositionCamera movementColorLightingCinema는 Visual language로 이해할 수 있다.“your choice of words (what you put in the shot/frame), the way you construct the sentence (the sequence of shots), correct use of punctuation (editing & continuity) and what you have to say (the story) are the key factors of creating effective cinema.”이 ..
-
Kling-Avatars: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis논문 정리 2026. 1. 7. 16:56
Abstract최근 audio-driven avatar video generation 분야가 크게 발전하고 있다.그러나 기존의 방법에서는 instruction conditioning을 단순히 audio나 visual cue에 의한 low-level으로 취급할 뿐, instruction이 전달하는 ‘의사소통 목적’을 모델링하지 않는다.이러한 한계로 인해 일관성과 캐릭터 표현력이 크게 감소한다.Kling-Avatar는 multimodal instruction understanding과 photorealistic portrait generation을 통합하는 novel cascaded framework이다.본 파이프라인은 두 개의 스테이지로 구성된다:Multimodal Large Language Model (..