본문으로 건너뛰기

Posts

23개의 글

2026
Product

늦게 돌아온 추출 워커의 완료 처리와 소유권 펜싱

문서 추출 작업의 임대가 만료돼도 이전 워커는 계속 실행될 수 있다. Deep Connector의 작업 점유와 완료 조건을 읽고, 소유권이 바뀐 뒤 도착한 결과를 거절하는 규칙을 설명용 모델로 확인했다.

architecturedecision-log
Product

Oracle 26ai에서 19c로, 요구사항 변경에 따른 전환 검토와 실험 설계

고객의 DB 버전 요구사항이 바뀌었을 때 Deep Connector의 JSON 저장, CLOB 검색, 애플리케이션 반환 처리를 어떻게 검토했는지 정리한다. 파일 규모 계측과 용량 추정, 아직 실행하지 않은 비교 시험을 구분한 의사결정 기록이다.

deep-connectororacledatabaseon-premise
Product

동의어 검색에서도 사용자가 입력한 단어를 먼저 찾기

DeepConnector 파일 검색은 사용자 입력과 사전 확장어를 함께 검색하되 서로 다른 가중치로 평가한다. 실제 스니펫 조립 코드를 설명용 데이터로 실행해 순위를 확인하고, 입력 상한과 확장 실패 처리의 경계를 짚었다.

architecturedecision-log
Product

워크스페이스 루트 하나의 조건, PostgreSQL과 Oracle의 유니크 인덱스

Deep Connector의 워크스페이스 루트 중복 방지를 PostgreSQL 부분 유니크 인덱스와 Oracle 함수 기반 유니크 인덱스로 구현한 구조를 설명한다. 최대 하나와 최소 하나의 차이, 최초 기동 시점, 외부 스키마 관리의 책임을 구분한다.

deep-connectorpostgresqloracledatabase
Product

테이블이 있는데 없다고 했다: Oracle 기동 오류를 좁혀간 기록

Deep Connector를 온프레미스 환경에 옮기면서 반복된 ORA-01031을 추적했다. 식별자 대소문자, 스키마 소유권, 기동 DDL을 분리하고 실제 권한 구조를 재현하면서 배운 점을 정리한다.

deep-connectororacletroubleshootingon-premise
Product

RAG 평가의 0점과 측정 불가를 구분하기

검색 실패와 평가하지 못한 항목을 같은 값으로 집계하면 평균이 달라진다. Deep Connector의 평가 집계 코드를 설명용 데이터로 실행하며 null, 0, 측정 행 수의 의미를 확인했다.

deep-connectorragevaluationdata-quality
Engineering

dupey: 본문 기반 문서 중복 및 버전 판별

dupey는 TXT, HWP/HWPX, DOCX, PDF 등에서 본문을 추출해 정확한 중복, 유사본, 포함 관계를 구분하는 로컬 Rust CLI다. 판정 원리와 10,018개 합성 문서 스캔, AutoRAG 인덱싱 연동을 직접 확인했다.

agentdocument-processingduplicate-detectionrust
Engineering

jikji: 에이전트의 파일 탐색 비용을 줄이는 로컬 인덱스

에이전트가 로컬 파일을 찾을 때 ls·find·grep으로 트리를 반복해서 훑는 대신, 미리 만들어둔 로컬 인덱스에서 단 한 번의 find 호출로 후보 슬레이트를 받게 해주는 jikji를 살펴본다. 임베딩·벡터 DB·RAG 없이 결정론적 시맨틱 검색을 하고, HWP·PDF부터 이미지·영상까지 내용 기반으로 찾는다. Rust CLI 기반 비파괴 도구로 원본은 건드리지 않고 .jikji/ 아래에 인덱스·문서 텍스트 캐시·에이전트 맵·지식 그래프를 만든다. 직접 돌려 prepare 비파괴성과 find --json 근거 팩을 확인했다.

agentsearchindexingrust
Engineering

MinSync: 파일이 바뀐 만큼만 다시 인덱싱하고, 청커로 그 비용을 좌우하기

MinSync는 git 없이 manifest로 파일 변경을 추적해 바뀐 청크만 다시 청킹·임베딩하고 로컬 LanceDB 인덱스를 최신 상태로 유지하는 단일 Rust CLI다. 테스트 결과 재임베딩 비용을 가른 건 청커 선택이었고, 같은 상단 삽입에서 recursive 111% vs cdc 27%로 갈렸다.

agentragvector-dbindexing
Engineering

Braincrew Tech 블로그를 시작합니다

Braincrew의 응용 AI 엔지니어링 기록을 공유하는 공식 기술블로그입니다.

announcement
Culture

Braincrew의 일하는 방식

수평적 협업과 실험 중심 문화 — Braincrew Culture 카테고리의 첫 글입니다.

culture
Engineering

agentdir: 원본은 그대로 두고 에이전트에게 작업하기 좋은 파일 구조를 따로 만들어주기

정리 안 된 원본 폴더는 그대로 두고, 에이전트에게는 목적에 맞게 재배치한 읽기 전용 가상 파일 트리를 만들어주는 agentdir를 살펴본다. CoW 파일시스템에서는 대용량 데이터셋을 여러 레이아웃에 노출해도 추가 디스크가 거의 들지 않고, 가상 뷰는 0o444로 읽기 전용이 된다.

agentfilesystemcontext-engineeringrust
Research

SEISMIC: Learned Sparse Retrieval을 위한 효율적 역색인 구조

SIGIR 2024 논문 리뷰 — LSR 벡터의 Concentration of Importance를 활용하여 기존 대비 100배 이상 빠른 근사 검색을 달성하는 SEISMIC 알고리즘

retrievalseminar
Research

The Effect of Dynamic Date Injection Methods on LLM Temporal Reasoning across Deictic Expression Granularities

LLM은 "어제", "다음 주"와 같은 상대적 시간 표현을 해석할 때 현재 날짜를 알 수 없어 날짜 주입이 필수입니다. 320회의 실험 결과, **한국어 형식(`2025년 3월 19일`) + User Prompt 조합**이 Simple/Structured 모두에서 95

agent
Research

Docker Log Monitor vs Sentry 비교 분석

Docker Log Monitor는 설치가 간단하고 비용이 들지 않으며 코드 수정 없이 즉시 사용 가능한 반면, Sentry는 풍부한 에러 컨텍스트와 분석 도구를 제공하지만 SDK 통합과 비용이 필요합니다. LG Electronics Agent 프로젝트의 경우, 이미

agent
Research

Docker Log Monitor 적용 가이드라인

EC2 환경에서 Docker 컨테이너 로그를 실시간 모니터링하고 에러 발생 시 Slack으로 알림을 보내는 경량 모니터링 시스템 구축 경험을 공유합니다. Sentry 같은 무거운 솔루션 대신, Python 기반의 간단한 스크립트로 실시간 로그 감지, 중복 알림 방지,

agent
Research

Which tabular format RAG Process understands very well?

RAG 파이프라인에서 테이블 데이터의 포맷이 검색 성능에 미치는 영향을 실험한 결과, Markdown Key-Value 형식이 가장 높은 Recall을 보였으며, TOON 포맷은 토큰 효율성 측면에서 가장 우수했습니다. AIHub의 표 정보 질의응답 데이터 50개를 7

data
2025
Research

메모랜덤 flow에 사용된 문서영역별 Clustering 성능평가

GS Caltex 메모랜덤-연구노트 매칭 프로젝트에서 PyMuPDF 기반 파서, Titan Embed V2 임베딩, ChromaDB 벡터 검색, Claude Sonnet 4.5 LLM 판정을 결합한 파이프라인을 구축했습니다. 137개 연구노트 중 82.5%가 메모랜덤과

rag
Research

근사 최근접 탐색(ANN) 오차와 데이터 분포 밀도의 관계 고찰

RAG 시스템에서 n_results는 단순히 '반환할 결과 개수'가 아닌 '검색 반경(search radius)'을 의미합니다. ANN 알고리즘의 근사 특성으로 인해 작은 n_results 값은 진짜 근접 벡터를 놓칠 수 있으며, 특히 고밀도 데이터 분포와 추상적 쿼리

rag
Engineering

IBK기업은행 여신 승인신청서 작성 업무 효율화

여신 승인신청서 및 심사보고서 자동 작성을 위한 생성형 AI 기반 RAG PoC를 구축하여 복잡한 금융 문서 작성 업무를 효율화한 사례입니다.

ai-agentragdocument-automationfinance
Engineering

LG전자 라이프로그 기반 개인화 AI 어시스턴트 구축

일상 활동 데이터를 그래프 기반 하이브리드 검색으로 연결하여 사용자 맥락을 이해하고 자연어 질문에 답변하는 AI Agent PoC를 구축한 사례입니다.

ai-agentragarchitecturecase-study
Research

MLflow 기술 검토(RAG 성능 실험 테스트베드 기능)

MLflow는 전통적인 ML과 LLM 애플리케이션의 전체 생명주기를 관리할 수 있는 오픈소스 통합 플랫폼입니다. LangGraph 기반 RAG Agent 개발 시 Tracking으로 하이퍼파라미터와 메트릭을 관리하고, Tracing으로 복잡한 LLM 호출 흐름을 추적하

evaluation
Research

LLM이 가장 잘 이해하는 Table Format에 대한 평가실험

재무제표 데이터를 LLM에 전달할 때 데이터 포맷에 따라 성능과 비용이 크게 달라집니다. 11가지 포맷을 비교한 결과, TSV(tab-separated) 포맷이 정확도 100%, 최소 토큰 사용(7,192개), 최단 응답시간(8.24초)으로 모든 지표에서 최고 성능을

evaluation