RISS 학술연구정보서비스

검색

인기 검색어

    다국어 입력

    http://chineseinput.net/에서 pinyin(병음)방식으로 중국어를 변환할 수 있습니다.

    변환된 중국어를 복사하여 사용하시면 됩니다.

    예시)
    • 中文 을 입력하시려면 zhongwen을 입력하시고 space를누르시면됩니다.
    • 北京 을 입력하시려면 beijing을 입력하시고 space를 누르시면 됩니다.
    닫기

    Agentic RAG의 성능과 효율 간 상충관계 최적화를 위한 경량 적응형 오케스트레이션 연구 = A Study on Lightweight Adaptive Orchestration to Optimize the Performance-Efficiency Trade-off in Agentic RAG

    한글로보기

    https://www.riss.kr/link?id=T17372082

    • 0

      상세조회
    • 0

      다운로드
    서지정보 열기
    • 내보내기
    • 내책장담기
    • 공유하기
    • 오류접수

    부가정보

    다국어 초록 (Multilingual Abstract) kakao i 다국어 번역

    Retrieval-Augmented Generation(RAG) has established itself as a critical framework for mitigating hallucinations and knowledge gaps in Large Language Models(LLM). While the evolution toward "Agentic RAG" has enabled autonomous planning and complex reasoning, indiscriminately applying such high-cost workflows to every user query creates a bottleneck, leading to prohibitive computational costs and latency.
    To resolve this inefficiency, this study proposes a Lightweight Adaptive Orchestration framework that dynamically determines execution strategies based on query complexity. We utilized Google’s Gemma-3-1B model, fine-tuned via QLoRA(Quantized Low-Rank Adaptation) for 4-bit quantization and parameter efficiency. The system classifies queries into three strategic pathways: “DIRECT” for simple fact verification, “PARALLEL” for multi-faceted analysis, and “SEQUENTIAL” for complex reasoning. This architecture ensures that computational resources are allocated only where necessary, preventing redundant operations.
    Experiments were conducted using a reconstructed dataset derived from Google Research’s Natural Questions. The proposed sLM-based orchestrator achieved a routing accuracy of approximately 98.7%, a performance comparable to GPT-4 based few-shot classification and significantly superior to heuristic rule-based or scoring-based methods. In terms of efficiency, the adaptive approach reduced end-to-end latency by roughly 29% compared to a baseline that applies high-cost strategies uniformly, while maintaining practical response quality.
    Notably, ablation studies revealed that the 1B model outperformed its 4B counterpart in routing accuracy. We interpret this result as a manifestation of optimization imbalance or inverse scaling, rather than simple overfitting. The larger 4B model struggled to converge on the specific decision boundaries of simpler tasks, whereas the 1B model demonstrated superior task-specific adaptation.
    These findings offer significant implications across academic and practical domains. Academically, this work extends adaptive RAG research by demonstrating that dynamic workflow selection is a viable alternative to binary retrieval decisions. Technically, it proves that purpose-built sLMs can outperform larger general-purpose models in specialized decision-making tasks, suggesting a promising direction for on-device AI. Practically, the framework presents a production-ready solution that simultaneously optimizes user experience and operational costs, suitable for deployment in large-scale, domain-specific applications such as legal or medical QA systems.
    번역하기

    Retrieval-Augmented Generation(RAG) has established itself as a critical framework for mitigating hallucinations and knowledge gaps in Large Language Models(LLM). While the evolution toward "Agentic RAG" has enabled autonomous planning and complex rea...

    Retrieval-Augmented Generation(RAG) has established itself as a critical framework for mitigating hallucinations and knowledge gaps in Large Language Models(LLM). While the evolution toward "Agentic RAG" has enabled autonomous planning and complex reasoning, indiscriminately applying such high-cost workflows to every user query creates a bottleneck, leading to prohibitive computational costs and latency.
    To resolve this inefficiency, this study proposes a Lightweight Adaptive Orchestration framework that dynamically determines execution strategies based on query complexity. We utilized Google’s Gemma-3-1B model, fine-tuned via QLoRA(Quantized Low-Rank Adaptation) for 4-bit quantization and parameter efficiency. The system classifies queries into three strategic pathways: “DIRECT” for simple fact verification, “PARALLEL” for multi-faceted analysis, and “SEQUENTIAL” for complex reasoning. This architecture ensures that computational resources are allocated only where necessary, preventing redundant operations.
    Experiments were conducted using a reconstructed dataset derived from Google Research’s Natural Questions. The proposed sLM-based orchestrator achieved a routing accuracy of approximately 98.7%, a performance comparable to GPT-4 based few-shot classification and significantly superior to heuristic rule-based or scoring-based methods. In terms of efficiency, the adaptive approach reduced end-to-end latency by roughly 29% compared to a baseline that applies high-cost strategies uniformly, while maintaining practical response quality.
    Notably, ablation studies revealed that the 1B model outperformed its 4B counterpart in routing accuracy. We interpret this result as a manifestation of optimization imbalance or inverse scaling, rather than simple overfitting. The larger 4B model struggled to converge on the specific decision boundaries of simpler tasks, whereas the 1B model demonstrated superior task-specific adaptation.
    These findings offer significant implications across academic and practical domains. Academically, this work extends adaptive RAG research by demonstrating that dynamic workflow selection is a viable alternative to binary retrieval decisions. Technically, it proves that purpose-built sLMs can outperform larger general-purpose models in specialized decision-making tasks, suggesting a promising direction for on-device AI. Practically, the framework presents a production-ready solution that simultaneously optimizes user experience and operational costs, suitable for deployment in large-scale, domain-specific applications such as legal or medical QA systems.

    더보기

    국문 초록 (Abstract) kakao i 다국어 번역

    검색 증강 생성(RAG, Retrieval-Augmented Generation)은 거대 언어 모델(LLM, Large Language Model)의 주요 한계인 환각 현상과 최신 정보의 부재 완화를 위해 시스템 설계의 핵심 프레임워크로 인식되고 있다. RAG의 지속적인 개선에 따라 단순 정보 검색을 넘어 자율적인 계획과 도구 사용이 가능한 Agentic RAG가 제안되었고 이를 통해 복잡한 추론이 필요한 질의에 대해서도 고품질의 답변을 생성하려는 시도가 이어져 왔다. 그러나 모든 사용자 질의에 대해 고비용 에이전트 워크플로우의 일괄 적용은 과도한 연산 비용과 지연 시간을 유발하며 시스템 효율성을 저하시키는 한계로 지목되고 있다.
    본 연구는 이러한 한계를 개선하고자 사용자 질의의 복잡도를 분석하여 실행 전략을 동적으로 결정하는 소형 언어 모델(sLM, Small Language Model) 기반의 경량 적응형 오케스트레이션(Lightweight Adaptive Orchestration) 프레임워크를 설계하였다. 제안된 시스템은 구글의 Gemma-3-1B 모델을 기반으로 하며 QLoRA(Quantized Low-Rank Adaptation)를 적용하여 4-bit 양자화 및 매개변수 효율적 미세 조정(Parameter-Efficient Fine-Tuning)을 수행하였다. 이를 통해 사용자 질의를 단순 사실 확인의 “DIRECT”, 다각적 분석을 요하는 “PARALLEL”, 복잡한 추론의 “SEQUENTIAL” 세 가지 전략으로 분류하고 각 유형에 최적화된 RAG 파이프라인으로 라우팅하여 불필요한 연산을 방지하고 응답 속도를 최적화하는 구조를 구현하였다.
    실험은 Google Research의 Natural Questions을 재구성하여 구축한 데이터셋을 기반으로 오케스트레이터의 라우팅 정확도와 전체 시스템의 효율성을 검증하기 위해 수행하였다. 학습 데이터는 각 전략별 균등 분포로 구성된 10,000 개의 질의 데이터를 활용하였으며 성능 평가는 라우팅 정확도, 지연 시간, 토큰 소비량 등 정량적 지표를 기준으로 수행하였다. 실험 결과로써 sLM 기반 오케스트레이터의 라우팅 정확도는 약 98.7%를 달성하였다. 이는 기존의 상용화된 서비스인 GPT-4 기반의 Few-shot 방식에 근접한 성능을 도출하였으며 경험적인 규칙 기반이나 점수 기반 방식을 크게 상회하는 성능을 보였다. 효율성 측면에서는 모든 사용자 질의의 고비용 전략 적용에 대비하여 실용 가능한 수준의 답변 품질을 유지하면서도 동시에 지연 시간을 약 29% 단축하였다. Ablation Study 결과에서는 1B 규모의 모델이 4B 규모의 모델보다 더 높은 라우팅 정확도를 달성하였다. 이는 4B 모델이 단순 패턴에 안착하려는 최적화 불균형 또는 역 스케일링 경향을 보인 것으로 해석되며 이는 1B 모델이 목적 특화 학습(Task-specific Learning)에서 상대적 우위를 보인다는 것을 의미한다.
    본 연구의 실험 결과를 기반으로 다음과 같은 내용을 도출할 수 있다.
    학술적 관점에서 본 연구는 기존 연구의 단순 검색 유무 결정 및 모델의 크기 조절에 국한된 적응형 RAG 설계를 넘어 워크플로우의 동적 선택을 새로운 접근법으로 제시한다. 이는 단순 검색과 복잡한 에이전트 협업을 하나의 통합된 시스템 내에서 유연하게 전환할 수 있음을 보여 유연한 RAG 시스템 아키텍처 연구를 제시한다.
    기술적인 측면에서 본 연구는 라우팅 작업에 있어 무조건 거대한 모델을 사용하는 것보다 특화된 모델을 구축하는 것이 유용하다는 것을 실증하였다. 실험 결과에 따르면 특정 목적에 맞춰 미세 조정된 sLM이 대규모 LLM이나 더 큰 매개변수의 모델보다 의사결정 작업에서 더 효율적이고 정확할 수 있음을 입증하였다. 이는 향후 온디바이스 AI 환경이나 자원이 제한된 시스템에서 고성능 오케스트레이터를 구축할 때 sLM과 QLoRA의 조합이 핵심적인 기술 요소로 작용할 수 있음을 시사한다.
    실무적인 측면에서 본 연구는 사용자 경험과 운영 비용의 동시 최적화 가능성을 입증하였다. 질의의 복잡도에 따라 자원을 유연하게 배분함으로써 단순 질의에는 빠른 응답 속도를 복잡한 질의에는 깊이 있는 추론을 제공하여 사용자의 만족도를 높일 수 있다. 이러한 시스템은 실제 산업 현장에서 대규모 고객 응대 시스템, 법률 및 의료 분야의 전문 질의응답 시스템 등에 실질적으로 적용 가능하며 API(Application Programming Interface) 호출 비용 절감과 시스템 응답성 향상이라는 두 가지 실무적 요구를 충족시키는 실무 적합성이 높은 솔루션이 될 수 있다.
    번역하기

    검색 증강 생성(RAG, Retrieval-Augmented Generation)은 거대 언어 모델(LLM, Large Language Model)의 주요 한계인 환각 현상과 최신 정보의 부재 완화를 위해 시스템 설계의 핵심 프레임워크로 인식되고 있...

    검색 증강 생성(RAG, Retrieval-Augmented Generation)은 거대 언어 모델(LLM, Large Language Model)의 주요 한계인 환각 현상과 최신 정보의 부재 완화를 위해 시스템 설계의 핵심 프레임워크로 인식되고 있다. RAG의 지속적인 개선에 따라 단순 정보 검색을 넘어 자율적인 계획과 도구 사용이 가능한 Agentic RAG가 제안되었고 이를 통해 복잡한 추론이 필요한 질의에 대해서도 고품질의 답변을 생성하려는 시도가 이어져 왔다. 그러나 모든 사용자 질의에 대해 고비용 에이전트 워크플로우의 일괄 적용은 과도한 연산 비용과 지연 시간을 유발하며 시스템 효율성을 저하시키는 한계로 지목되고 있다.
    본 연구는 이러한 한계를 개선하고자 사용자 질의의 복잡도를 분석하여 실행 전략을 동적으로 결정하는 소형 언어 모델(sLM, Small Language Model) 기반의 경량 적응형 오케스트레이션(Lightweight Adaptive Orchestration) 프레임워크를 설계하였다. 제안된 시스템은 구글의 Gemma-3-1B 모델을 기반으로 하며 QLoRA(Quantized Low-Rank Adaptation)를 적용하여 4-bit 양자화 및 매개변수 효율적 미세 조정(Parameter-Efficient Fine-Tuning)을 수행하였다. 이를 통해 사용자 질의를 단순 사실 확인의 “DIRECT”, 다각적 분석을 요하는 “PARALLEL”, 복잡한 추론의 “SEQUENTIAL” 세 가지 전략으로 분류하고 각 유형에 최적화된 RAG 파이프라인으로 라우팅하여 불필요한 연산을 방지하고 응답 속도를 최적화하는 구조를 구현하였다.
    실험은 Google Research의 Natural Questions을 재구성하여 구축한 데이터셋을 기반으로 오케스트레이터의 라우팅 정확도와 전체 시스템의 효율성을 검증하기 위해 수행하였다. 학습 데이터는 각 전략별 균등 분포로 구성된 10,000 개의 질의 데이터를 활용하였으며 성능 평가는 라우팅 정확도, 지연 시간, 토큰 소비량 등 정량적 지표를 기준으로 수행하였다. 실험 결과로써 sLM 기반 오케스트레이터의 라우팅 정확도는 약 98.7%를 달성하였다. 이는 기존의 상용화된 서비스인 GPT-4 기반의 Few-shot 방식에 근접한 성능을 도출하였으며 경험적인 규칙 기반이나 점수 기반 방식을 크게 상회하는 성능을 보였다. 효율성 측면에서는 모든 사용자 질의의 고비용 전략 적용에 대비하여 실용 가능한 수준의 답변 품질을 유지하면서도 동시에 지연 시간을 약 29% 단축하였다. Ablation Study 결과에서는 1B 규모의 모델이 4B 규모의 모델보다 더 높은 라우팅 정확도를 달성하였다. 이는 4B 모델이 단순 패턴에 안착하려는 최적화 불균형 또는 역 스케일링 경향을 보인 것으로 해석되며 이는 1B 모델이 목적 특화 학습(Task-specific Learning)에서 상대적 우위를 보인다는 것을 의미한다.
    본 연구의 실험 결과를 기반으로 다음과 같은 내용을 도출할 수 있다.
    학술적 관점에서 본 연구는 기존 연구의 단순 검색 유무 결정 및 모델의 크기 조절에 국한된 적응형 RAG 설계를 넘어 워크플로우의 동적 선택을 새로운 접근법으로 제시한다. 이는 단순 검색과 복잡한 에이전트 협업을 하나의 통합된 시스템 내에서 유연하게 전환할 수 있음을 보여 유연한 RAG 시스템 아키텍처 연구를 제시한다.
    기술적인 측면에서 본 연구는 라우팅 작업에 있어 무조건 거대한 모델을 사용하는 것보다 특화된 모델을 구축하는 것이 유용하다는 것을 실증하였다. 실험 결과에 따르면 특정 목적에 맞춰 미세 조정된 sLM이 대규모 LLM이나 더 큰 매개변수의 모델보다 의사결정 작업에서 더 효율적이고 정확할 수 있음을 입증하였다. 이는 향후 온디바이스 AI 환경이나 자원이 제한된 시스템에서 고성능 오케스트레이터를 구축할 때 sLM과 QLoRA의 조합이 핵심적인 기술 요소로 작용할 수 있음을 시사한다.
    실무적인 측면에서 본 연구는 사용자 경험과 운영 비용의 동시 최적화 가능성을 입증하였다. 질의의 복잡도에 따라 자원을 유연하게 배분함으로써 단순 질의에는 빠른 응답 속도를 복잡한 질의에는 깊이 있는 추론을 제공하여 사용자의 만족도를 높일 수 있다. 이러한 시스템은 실제 산업 현장에서 대규모 고객 응대 시스템, 법률 및 의료 분야의 전문 질의응답 시스템 등에 실질적으로 적용 가능하며 API(Application Programming Interface) 호출 비용 절감과 시스템 응답성 향상이라는 두 가지 실무적 요구를 충족시키는 실무 적합성이 높은 솔루션이 될 수 있다.

    더보기

    목차 (Table of Contents)

    • 제 1 장 서론 1
    • 1.1. 연구 배경 및 필요성 1
    • 1.2. 연구 목표 및 핵심 기여 3
    • 1.3. 연구 구성 4
    • 제 2 장 관련 연구 5
    • 제 1 장 서론 1
    • 1.1. 연구 배경 및 필요성 1
    • 1.2. 연구 목표 및 핵심 기여 3
    • 1.3. 연구 구성 4
    • 제 2 장 관련 연구 5
    • 2.1. NLP 개요 5
    • 2.2. LLM의 등장 배경 6
    • 2.3. RAG의 발전 6
    • 2.3.1. Naive RAG & Advanced RAG 7
    • 2.3.2. Agentic RAG 8
    • 2.4. 사용자 질의 라우팅(Query Routing) 10
    • 2.5 sLM 미세 조정 기법 14
    • 2.5.1. sLM의 정의와 장점 14
    • 2.5.2. PEFT의 정의 및 분류 14
    • 2.5.3. LoRA(Low-Rank Adaptation) 14
    • 2.5.4. QLoRA(Quantized LoRA) 14
    • 2.5.5. 본 연구와의 연결 15
    • 제 3 장 설계 및 구현 16
    • 3.1. 전체 시스템 아키텍처 개요 16
    • 3.2. 오케스트레이터 18
    • 3.2.1. 모델 선정 및 아키텍처 19
    • 3.2.2. QLoRA 기반 PEFT 19
    • 3.3. RAG 실행기 그룹 21
    • 3.3.1. Naive RAG: DIRECT 전략 21
    • 3.3.2. Multi-Agent RAG: PARALLEL 전략 22
    • 3.3.3. Chain-of-Thought RAG: SEQUENTIAL 전략 22
    • 3.4. 벡터 DB 23
    • 3.4.1. 임베딩 모델 선정 23
    • 3.4.2. 문서 전처리 및 청킹 전략 25
    • 3.4.3. Chroma DB 구성 25
    • 제 4 장 실험 및 평가 26
    • 4.1. 실험 환경 26
    • 4.1.1. 데이터셋 27
    • 4.1.2. 모델 구성 요소 상세 30
    • 4.1.3. 하이퍼파라미터 구성 31
    • 4.1.4. 평가지표 32
    • 4.2. 실험 결과 36
    • 4.2.1. 실험 1: 오케스트레이터 라우팅 전략 비교 37
    • 4.2.2. 실험 2: 오케스트레이터 라우팅 정확도 평가 39
    • 4.2.3. 실험 3: 쿼리 복잡도 적응성 평가 40
    • 4.2.4. 실험 4: 종단 간 시스템 비교 41
    • 4.2.5. 실험 5: Ablation Test 43
    • 제 5 장 결론 및 한계 46
    • 5.1. 연구 요약 46
    • 5.2. 연구의 시사점 및 기여도 46
    • 5.3. 연구의 한계 및 향후 연구 방향 47
    • 5.3.1. 도메인 일반화의 한계 47
    • 5.3.2. 정적 라우팅의 유연성 부족 47
    • 5.3.3. 다국어 및 멀티모달 확장성 검증 필요 47
    • 5.4. 결론 47
    • 참고 문헌 48
    • 영문초록 53
    • 부록 55
    더보기

    분석정보

    View

    상세정보조회

    0

    Usage

    원문다운로드

    0

    대출신청

    0

    복사신청

    0

    EDDS신청

    0

    동일 주제 내 활용도 TOP

    더보기

    주제

    연도별 연구동향

    연도별 활용동향

    연관논문

    연구자 네트워크맵

    공동연구자 (7)

    유사연구자 (20) 활용도상위20명

    이 자료와 함께 이용한 RISS 자료

    나만을 위한 추천자료

    해외이동버튼