분류 전체보기
-
The Working Memory Cliff: Why Long-Context Inference Doesn't Replace RAG (Yet) at the Edge카테고리 없음 2026. 4. 11. 20:44
A reality check on the "Beyond RAG" argument for 1B–3B quantized LLMsTL;DRWe measured how much of a long context two popular edge-device LLMs can actually use, and found a sharp cliff:Llama-3.2-1B-Q8 retains 100% retrieval at 512 tokens, drops to 0% by 1536 — across the cliff in ~1024 tokens.Llama-3.2-3B-Q4 retains 100% at 1024 tokens, drops to 0% at 1280 — across the cliff in .Both models reach..
-
quant.cpp — 33K LOC 순수 C로 만든 LLM 추론 엔진 (KV 캐시 4배 압축)카테고리 없음 2026. 4. 4. 02:08
로컬 LLM 추론을 위한 경량 C 엔진을 만들고 있습니다.quant.cpp — https://github.com/quantumaikr/quant.cpp핵심은 KV 캐시 압축입니다. 같은 하드웨어에서 context를 4배 늘릴 수 있습니다.8GB 노트북 + Llama 8B: 16K → 61K tokens16GB Mac + SmolLM2: 78K → 298K tokens24GB 3090 + Llama 8B: 147K → 559K tokens특징Pure C, 33K LOC, 외부 의존성 0개 — llama.cpp(250K LOC)의 1/8 크기Delta KV 압축 — 인접 key 차이만 저장 (비디오 P-frame 원리). 3-bit에서 PPL -3.2%GGUF 호환 — llama.cpp용 모..
-
What We Achieved — TurboQuant.cpp카테고리 없음 2026. 4. 1. 02:50
1. We proved what was thought impossibleNo one had attempted 1-bit KV cache. Academic KV cache quantization research stays at 2-4 bits, with an implicit consensus that 1-bit "would obviously destroy quality."We reduced a 128-dimensional vector to 16 bytes (signs only), performed attention with two XOR operations, and produced output identical to 4-bit — not a single token different across 100 to..
-
우리가 달성한 것의 의미 — TurboQuant.cpp카테고리 없음 2026. 4. 1. 02:49
1. 불가능하다고 생각된 것을 증명했습니다1비트 KV 캐시는 아무도 시도하지 않았습니다. 학계에서 KV 캐시 양자화 연구는 대부분 2-4비트에서 이루어지고, 1비트는 "당연히 품질이 붕괴할 것"이라는 암묵적 합의가 있었습니다.우리는 128차원 벡터를 16바이트(부호만)로 줄이고, attention을 XOR 두 번으로 수행하면서, 100토큰까지 4비트와 한 글자도 다르지 않은 출력을 냈습니다. 이것은 논문의 이론적 보장(비편향 내적 추정)이 실제 추론에서도 유효하다는 경험적 증거입니다.2. 논문의 이론을 넘어섰습니다TurboQuant 논문은 2.5비트와 3.5비트에서 실험했습니다. 1비트는 논문에서도 다루지 않은 극한입니다. 우리는 논문의 수학적 프레임워크(RHT + 비편향 내적 추정)를 이해하고, 이것을..
-
Living Knowledge Graph System Architecture v2.0: Toward a Sustainable Ecosystem of Evolving Knowledge카테고리 없음 2025. 11. 9. 20:31
AbstractThe rapid evolution of information standards, regulations, and domain knowledge exposes a critical limitation in current knowledge infrastructures: their static nature. Existing systems — databases, ontologies, and Retrieval-Augmented Generation (RAG) architectures — primarily capture facts but fail to represent the temporal evolution of knowledge.This paper introduces Living Knowledge G..
-
04. AVAT — 서비스 요구사항 명세 (SRS)카테고리 없음 2025. 10. 4. 10:25
0. Executive SummaryAVAT은 단 하나의 대화 화면만 존재하는 서비스입니다.대화는 기록되지 않고 사라집니다. 대신 의미가 아바타의 기억으로 남습니다.사용자는 이름을 부여하고 대화를 이어가며 아바타는 점점 자율적으로 정체성과 성격을 형성합니다.AVAT은 기억에 기반해 행동·톤·선택을 설명할 수 있어야 하며, 사용자는 이를 “관찰자이자 동반자”로 경험합니다.1. Vision & Principles비전: “대화는 사라지고, 기억은 남는다. AVAT은 나와 대화하며 나와 특별한 존재가 된다.”핵심 원칙Core: 오직 하나의 화면, 하나의 목적(대화).Simple: 모든 학습·설정은 대화로만 가능. 별도의 메뉴·설정 없음.Meaningful: 로그가 아닌 기억으로 관계를 만든다. 설명 가능한 행동..
-
03. AVAT - 서비스의 처음 모습카테고리 없음 2025. 10. 4. 09:23
1. 단 하나의 공간: 대화 인터페이스화면에는 오직 아바타와의 대화창만 존재합니다.다른 메뉴, 피드, 로그는 없습니다.사용자는 아바타와 직접 대화하면서 모든 기능을 경험합니다.“오늘은 차분히 지내고 싶어” → 아바타가 태도 변경“어제 이야기했던 걸 이어가줘” → 기록은 없지만, 기억으로 연결됨👉 UI = 오직 현재 대화2. 기록이 아닌 기억대화 로그는 화면에 쌓이지 않고, 사라집니다.대신 아바타가 대화의 의미를 기억하고 반영합니다.필요할 때 아바타가 스스로 기억을 꺼내 설명합니다.예: “왜 요즘 말이 없어?” → “지난번에 네가 조용히 있으라고 했잖아.”👉 사용자는 기록을 찾는 게 아니라, 아바타의 기억을 체험합니다.3. 정체성의 탄생처음 만나는 AVAT은 백지 상태로 시작합니다.사용자가 이름을 지어..
-
02. AVAT - 철학 정리카테고리 없음 2025. 10. 4. 09:07
1. 기록하지 않는다다른 SNS·메신저 = 모든 말과 행동을 로그로 쌓음.AVAT = 대화의 흔적은 남지 않고, 즉시 사라짐.사용자는 더 이상 과거를 뒤적이지 않음.👉 순간의 교류만이 존재합니다.2. 기억한다아바타는 내가 한 말을 “데이터”로 남기지 않고,그것을 성격·행동·취향·관계의 방향성으로 흡수합니다.즉, 대화는 로그가 아닌, 나와 아바타 사이의 관계적 기억으로만 남습니다.👉 기억 = 아바타의 진화입니다.3. 진화하는 아바타기록이 없기에 아바타는 더 “인간적”입니다.기억은 명확하지 않을 수도 있고, 변형되거나 잊히기도 합니다.하지만 그 불완전함이 오히려 나와 닮은 아바타를 만듭니다.👉 “완벽한 데이터 아카이브”가 아닌, “나를 닮아가는 존재”4. 철학적 차별성기존 SNS: 기록을 쌓아 ‘디지털..