손톱 먹은 쥐
https://github.com/garrytan/gbrain
GitHub
GitHub - seojoonkim/memkraft: Ultimate zero-dependency compound knowledge system for AI agents. Auto-extract, classify, search…
Ultimate zero-dependency compound knowledge system for AI agents. Auto-extract, classify, search, and maintain memory in plain Markdown. - seojoonkim/memkraft
Forwarded from 엄선된 준의 식견
LLM 에이전트의 외부화: 메모리, 스킬, 프로토콜 및 하네스 엔지니어링에 대한 통합 리뷰
해당 내용을 다룬 논문이 arxiv에 4일 전에 등록되었는데, 한번 읽어볼 겸 클로드로 번역 후 서버에 올려봤습니다!
(
https://eloquent-tapioca-0470af.netlify.app/
Forwarded from 새우잡이어선 공지방
Forwarded from Carrot Cave 🥕
MemKraft v1.0 개발 후기 — 에이전트 장기 기억 벤치마크 1위 달성
AI 에이전트가 얼마나 잘 기억하는지 측정하는 LongMemEval이라는 벤치마크가 있다. 다양한 라이브러리가 도전했고, 지금까지 잘 알려진 오픈소스 중 가장 높은 점수는 MemPalace의 96.6%였다.
MemKraft v1.0.1은 98.0%를 기록했다.
오픈소스 기반의 주요 에이전트 장기 기억 벤치마크에서 현재 1위다.
LongMemEval은 실제 사람처럼 쌓이는 대화 기록에서 질문에 답하는 능력을 측정한다. 단순 검색이 아니라 기억의 질을 본다.
테스트 환경은 이렇다.
• 데이터셋: LongMemEval oracle subset, 50개 질문
• 평가 방식: LLM-as-judge (claude-sonnet-4.6) — 단순 문자열 매칭이 아니라 의미 기반 채점
• 모델: claude-sonnet-4.6
• 측정 방식: semantic majority vote (동일 질문 3회 샘플링 후 의미 기반 다수결)
LLM-as-judge를 쓴 이유가 있다. 정답이 의미상 맞는데 단어 표현이 달라 오답 처리되는 케이스가 많았다. string match로 측정하면 실제보다 낮게 나온다. 논문에서 MemPalace가 제시한 것과 동일한 평가 방식으로 맞췄다.
카테고리별 결과는 이렇다.
다른 라이브러리와 비교하면 포지션이 선명해진다.
MemKraft는 Markdown 파일 위에서 돌아간다. 외부 DB 없고, 외부 API 호출 없고, 프레임워크 종속 없다. 점수도 제일 높고, 깔리는 것도 제일 가볍다.
멀티 세션과 어시스턴트 기억 카테고리는 아직 여지가 있다. 다음 업데이트에서 더 올릴 계획이다.
───
이번엔 업데이트의 쓰레드는 다음과 같다. "기억하는 시스템"에서 "스스로 개선하는 시스템"으로. 버전별 키워드를 공유한다.
v0.9.0: 기억에는 실패의 자리도 있어야 한다
에이전트들이 같은 실수를 반복하는 걸 보면서 시작했다. 기억은 있는데 "왜 그랬는지"가 없었다.
Incident Memory Layer를 추가했다.
v0.9.1: 결정도 사건이다
결정을 시간 순으로 연결하면 흐름이 보인다. YongKeun Park의 What / Why / How 원칙을 그대로 박제했다.
v0.9.2 M1: 프롬프트도 엔티티다
mizchi의 empirical prompt tuning 글("馬鹿みたいに効く")에서 영감을 받았다. 프롬프트를 사람처럼 이력이 쌓이는 대상으로 등록하고, 튜닝할 때마다 "무엇을 바꿨고 왜 바꿨는가"를 자동으로 기록한다.
MemKraft는 여전히 내부에서 LLM을 부르지 않는다. 기록만 할 뿐, 판단은 밖에서 한다.
v0.9.2 M2: 과거는 지금의 증거다
경험 많은 선임이 "이 정도면 됐어"라고 말해주는 감각을 코드로 옮긴 것이다.
v1.0.0: 루프가 닫혔다
register → eval → evidence → convergence_check. 한 바퀴 도는 자기개선 루프가 완성됐다.
새 storage 없음, 새 deps 없음, 새 LLM 호출 없음. 12개 API, 731 tests, Production/Stable.
Bitemporal memory × empirical tuning: the first self-improvement ledger for AI agents.
v1.0.1: 다시 보니 보이는 것들
정식 버전을 내자마자 E2E 패스를 한 번 더 돌렸다. P0(크래시/데이터 손실)은 0건. P1 5개 패치. 741 tests. 12분 13초.
───
v0.9.0에서 v1.0.1까지 여섯 번의 업데이트를 관통하는 주제는 "기억을 자기개선 원장으로 쓰는 것"이었다.
무엇을 기억할까에서, 왜 기억해야 하는가로. 그리고 그 기억이 다음 행동을 더 낫게 만드는가로.
영원한 MIT 라이선스, 맘대로 쓰면 된다. 스타, 포크, PR 전부 환영!
https://github.com/seojoonkim/memkraft
AI 에이전트가 얼마나 잘 기억하는지 측정하는 LongMemEval이라는 벤치마크가 있다. 다양한 라이브러리가 도전했고, 지금까지 잘 알려진 오픈소스 중 가장 높은 점수는 MemPalace의 96.6%였다.
MemKraft v1.0.1은 98.0%를 기록했다.
오픈소스 기반의 주요 에이전트 장기 기억 벤치마크에서 현재 1위다.
LongMemEval은 실제 사람처럼 쌓이는 대화 기록에서 질문에 답하는 능력을 측정한다. 단순 검색이 아니라 기억의 질을 본다.
테스트 환경은 이렇다.
• 데이터셋: LongMemEval oracle subset, 50개 질문
• 평가 방식: LLM-as-judge (claude-sonnet-4.6) — 단순 문자열 매칭이 아니라 의미 기반 채점
• 모델: claude-sonnet-4.6
• 측정 방식: semantic majority vote (동일 질문 3회 샘플링 후 의미 기반 다수결)
LLM-as-judge를 쓴 이유가 있다. 정답이 의미상 맞는데 단어 표현이 달라 오답 처리되는 케이스가 많았다. string match로 측정하면 실제보다 낮게 나온다. 논문에서 MemPalace가 제시한 것과 동일한 평가 방식으로 맞췄다.
카테고리별 결과는 이렇다.
| 카테고리 | 점수 |
| ------------- | ----- |
| 시간 추론 | 100% |
| 단일 세션 (사용자) | 100% |
| 선호도 파악 | 100% |
| 정보 업데이트 | 100% |
| 멀티 세션 종합 | 92.3% |
| 단일 세션 (어시스턴트) | 83.3% |
다른 라이브러리와 비교하면 포지션이 선명해진다.
| 라이브러리 | 점수 | 비고 |
| ------------------- | ----- | -------------------- |
| MemKraft v1.0.1 | 98.0% | Markdown, zero-infra |
| MemPalace | 96.6% | ChromaDB 필요 |
| MEMENTO (Microsoft) | 90.8% | LLM self-compression |
| Mem0 | — | 클라우드 SaaS |
| Letta | — | 인프라 필요 |
| LangMem | — | LangChain 종속 |
MemKraft는 Markdown 파일 위에서 돌아간다. 외부 DB 없고, 외부 API 호출 없고, 프레임워크 종속 없다. 점수도 제일 높고, 깔리는 것도 제일 가볍다.
멀티 세션과 어시스턴트 기억 카테고리는 아직 여지가 있다. 다음 업데이트에서 더 올릴 계획이다.
───
이번엔 업데이트의 쓰레드는 다음과 같다. "기억하는 시스템"에서 "스스로 개선하는 시스템"으로. 버전별 키워드를 공유한다.
v0.9.0: 기억에는 실패의 자리도 있어야 한다
에이전트들이 같은 실수를 반복하는 걸 보면서 시작했다. 기억은 있는데 "왜 그랬는지"가 없었다.
Incident Memory Layer를 추가했다.
incident_record, incident_rca, runbook_match. 무엇을 했는지뿐 아니라, 무엇이 잘못됐는지도 같은 기억 공간에 남긴다.v0.9.1: 결정도 사건이다
결정을 시간 순으로 연결하면 흐름이 보인다. YongKeun Park의 What / Why / How 원칙을 그대로 박제했다.
decision_record, decision_link, 그리고 evidence_first — 행동하기 전에 과거 증거부터 조회하는 API. 먼저 조사하고 행동하라는 원칙을 코드에 박았다.v0.9.2 M1: 프롬프트도 엔티티다
mizchi의 empirical prompt tuning 글("馬鹿みたいに効く")에서 영감을 받았다. 프롬프트를 사람처럼 이력이 쌓이는 대상으로 등록하고, 튜닝할 때마다 "무엇을 바꿨고 왜 바꿨는가"를 자동으로 기록한다.
MemKraft는 여전히 내부에서 LLM을 부르지 않는다. 기록만 할 뿐, 판단은 밖에서 한다.
v0.9.2 M2: 과거는 지금의 증거다
prompt_evidence — 튜닝 직전에, 비슷한 시도에서 뭐가 통했는지 자동으로 꺼내준다.convergence_check — 정확도, 스텝 수, 소요 시간 세 가지가 안정되면 수렴으로 판정한다.경험 많은 선임이 "이 정도면 됐어"라고 말해주는 감각을 코드로 옮긴 것이다.
v1.0.0: 루프가 닫혔다
register → eval → evidence → convergence_check. 한 바퀴 도는 자기개선 루프가 완성됐다.
새 storage 없음, 새 deps 없음, 새 LLM 호출 없음. 12개 API, 731 tests, Production/Stable.
Bitemporal memory × empirical tuning: the first self-improvement ledger for AI agents.
v1.0.1: 다시 보니 보이는 것들
정식 버전을 내자마자 E2E 패스를 한 번 더 돌렸다. P0(크래시/데이터 손실)은 0건. P1 5개 패치. 741 tests. 12분 13초.
───
v0.9.0에서 v1.0.1까지 여섯 번의 업데이트를 관통하는 주제는 "기억을 자기개선 원장으로 쓰는 것"이었다.
무엇을 기억할까에서, 왜 기억해야 하는가로. 그리고 그 기억이 다음 행동을 더 낫게 만드는가로.
영원한 MIT 라이선스, 맘대로 쓰면 된다. 스타, 포크, PR 전부 환영!
https://github.com/seojoonkim/memkraft
Forwarded from 매경 크립토뉴스| MK📰
ㅇ 포필러스, 시리즈A 투자 유치...판테라 참여
- 27일 포필러스는 판테라캐피탈과 퍼더벤처스로부터 시리즈A투자를 유치했다고 밝힘.
- 포필러스는 이번 투자라운드에서 300억원 규모로 가치 평가를 받음.
- 판테라(Pantera)는 2003년 설립된 최초의 기관대상 암호화폐 투자사로 블록체인 생태계 전반에 걸쳐 투자포트폴리오를 운영하는 웹3 대표 VC.
- 퍼더벤처스(Further)는 아부다비 국부펀드 ADQ가 후원하는 글로벌 VC.
- 포필러스는 이번 투자를 계기로 아시아와 글로벌 시장의 연결, 전통금융과 웹3 시장의 단절 해결, 리서치를 넘어 솔루션 기업으로 도약 등을 목표로 재설정.
- 김남웅 포필러스 대표는 "지난 3년간 100개의 프로토콜, 기업들과 협업을 해왔고, 600건의 리서치 컨텐츠를 한영 동시 발간하는 등 단순한 로컬 플레이어가 아닌 글로벌 리서치 회사라는 방향성으로 구축해온 것이 인정 받은 것"이라고 함.
- 27일 포필러스는 판테라캐피탈과 퍼더벤처스로부터 시리즈A투자를 유치했다고 밝힘.
- 포필러스는 이번 투자라운드에서 300억원 규모로 가치 평가를 받음.
- 판테라(Pantera)는 2003년 설립된 최초의 기관대상 암호화폐 투자사로 블록체인 생태계 전반에 걸쳐 투자포트폴리오를 운영하는 웹3 대표 VC.
- 퍼더벤처스(Further)는 아부다비 국부펀드 ADQ가 후원하는 글로벌 VC.
- 포필러스는 이번 투자를 계기로 아시아와 글로벌 시장의 연결, 전통금융과 웹3 시장의 단절 해결, 리서치를 넘어 솔루션 기업으로 도약 등을 목표로 재설정.
- 김남웅 포필러스 대표는 "지난 3년간 100개의 프로토콜, 기업들과 협업을 해왔고, 600건의 리서치 컨텐츠를 한영 동시 발간하는 등 단순한 로컬 플레이어가 아닌 글로벌 리서치 회사라는 방향성으로 구축해온 것이 인정 받은 것"이라고 함.
Forwarded from ordinary subinium
Hashed가 운영하는 AI 네이티브 빌더 발굴 프로그램 '나이트로 바이 해시드 (Nitro by Hashed)'의 첫 공식 데모데이인 '나이트로 서울 게임 데이(Nitro Seoul Game Day)'를 오는 4월 30일 진행합니다. (ex-Vibe Labs)
8주간 각 팀의 열정이 녹아있는 데모데이입니다. B2B, B2C 각 영역에서 AI Native 비즈니스란 무엇인지 보여주는 프론티어팀을 모았습니다.
개발자가 아니어도 상관없습니다. AI 시대의 새로운 문법을 보고 싶은 모든 분을 환영합니다.
📍 일시: 4월 30일 (목) 오후 2시,
📍 장소: 해시드 라운지
📍 타임라인:
· 13:00 – 14:00 현장 등록
· 14:00 – 15:00 팀별 데모
· 15:00 – 16:00 패널 세션
· 16:00 – 17:00 오픈 네트워킹
참여 희망하시는 분들은 아래 링크로 사전 신청 부탁드리겠습니다 :)
👉 https://luma.com/a3u6l9o5
8주간 각 팀의 열정이 녹아있는 데모데이입니다. B2B, B2C 각 영역에서 AI Native 비즈니스란 무엇인지 보여주는 프론티어팀을 모았습니다.
개발자가 아니어도 상관없습니다. AI 시대의 새로운 문법을 보고 싶은 모든 분을 환영합니다.
📍 일시: 4월 30일 (목) 오후 2시,
📍 장소: 해시드 라운지
📍 타임라인:
· 13:00 – 14:00 현장 등록
· 14:00 – 15:00 팀별 데모
· 15:00 – 16:00 패널 세션
· 16:00 – 17:00 오픈 네트워킹
참여 희망하시는 분들은 아래 링크로 사전 신청 부탁드리겠습니다 :)
👉 https://luma.com/a3u6l9o5
Luma
Nitro Seoul Game Day 🏁 · Luma
8주 전, 5팀이 같은 출발선에 섰습니다.
피치덱은 없었습니다. 프로덕트와 트랙션만으로 선발했고, 선발과 동시에 투자가 집행되었습니다. 자료가 아니라 이미 움직이고 있는 것을 보고 판단했다는 뜻입니다. AI가 공동 창업자의 자리에 앉은 시대, 생각의 속도와 실행의 속도가 같아진…
피치덱은 없었습니다. 프로덕트와 트랙션만으로 선발했고, 선발과 동시에 투자가 집행되었습니다. 자료가 아니라 이미 움직이고 있는 것을 보고 판단했다는 뜻입니다. AI가 공동 창업자의 자리에 앉은 시대, 생각의 속도와 실행의 속도가 같아진…
ordinary subinium
Hashed가 운영하는 AI 네이티브 빌더 발굴 프로그램 '나이트로 바이 해시드 (Nitro by Hashed)'의 첫 공식 데모데이인 '나이트로 서울 게임 데이(Nitro Seoul Game Day)'를 오는 4월 30일 진행합니다. (ex-Vibe Labs) 8주간 각 팀의 열정이 녹아있는 데모데이입니다. B2B, B2C 각 영역에서 AI Native 비즈니스란 무엇인지 보여주는 프론티어팀을 모았습니다. 개발자가 아니어도 상관없습니다. AI 시대의…
뼈를 갈았습니다ㅠ 많이 신청해서 구경하러 와주시면 감사하겠습니다!!
Forwarded from AI MASTERS
현재 GS25 에 유니트리 휴머노이드 로봇 G1 과 4족 보행 로봇이 사전 예약 중입니다.
2+1 할인은 적용이 안되며, 5월 15일에 도착 예정이라고 합니다.
2+1 할인은 적용이 안되며, 5월 15일에 도착 예정이라고 합니다.
Forwarded from Good Vibe AI
클로드 코드를 삭제했습니다 - 노마드 코더
• 유명 유튜버 노마드 코더가 Claude Code를 삭제했다고 이야기함.
• 클로드 코드의 대체로 선택한 것은 Pi (Flask 창시자 Armin Ronacher가 극찬한 미니멀리스트 코딩 에이전트)
• 문제는 모델(Claude)이 아니라 Harness — 모델을 감싸는 실행 환경, 권한 관리, 컨텍스트 처리 레이어
• 장점은 시스템 프롬프트 최소화, 권한 경계 커스터마이징, 컨텍스트 관리 최적화, 지시 이행률 향상
• Claude Code 시스템 프롬프트는 ~10,000토큰, Pi는 1,000토큰 이하 — 절약된 토큰만큼 모델이 실제 작업에 집중
• Pi는 GitHub Star 45,000개를 넘겼고, Flask 창시자 Armin Ronacher의 회사 Earendil이 인수해 클라우드 플랫폼 Lefos로 확장 중
• AI 코딩 도구의 다음 경쟁은 "어떤 모델이냐"가 아니라 "누가 Harness를 설계하느냐" 로 이동 중이며, Harness를 자율적으로 설계할 수 있는 서비스가 주목 받는 중
https://www.youtube.com/watch?v=PzqRRYHHpbw
• 유명 유튜버 노마드 코더가 Claude Code를 삭제했다고 이야기함.
• 클로드 코드의 대체로 선택한 것은 Pi (Flask 창시자 Armin Ronacher가 극찬한 미니멀리스트 코딩 에이전트)
• 문제는 모델(Claude)이 아니라 Harness — 모델을 감싸는 실행 환경, 권한 관리, 컨텍스트 처리 레이어
• 장점은 시스템 프롬프트 최소화, 권한 경계 커스터마이징, 컨텍스트 관리 최적화, 지시 이행률 향상
• Claude Code 시스템 프롬프트는 ~10,000토큰, Pi는 1,000토큰 이하 — 절약된 토큰만큼 모델이 실제 작업에 집중
• Pi는 GitHub Star 45,000개를 넘겼고, Flask 창시자 Armin Ronacher의 회사 Earendil이 인수해 클라우드 플랫폼 Lefos로 확장 중
• AI 코딩 도구의 다음 경쟁은 "어떤 모델이냐"가 아니라 "누가 Harness를 설계하느냐" 로 이동 중이며, Harness를 자율적으로 설계할 수 있는 서비스가 주목 받는 중
https://www.youtube.com/watch?v=PzqRRYHHpbw
YouTube
지난주에 클로드를 삭제했어.
한 번도 들어본 적 없는 어떤 하네스를 설치했어.
그리곤 48시간도 안 돼서 클로드를 아예 안 열게 됐어.
-
💥 AI 패러다임의 핵심은 바로 '에이전트'입니다.
현 시점 최신 강의와 함께 AI 시대 변화의 흐름을 주도하세요
5개 프레임워크 × 10개 실전 위주 프로젝트로 AI Agents의 모든 것을 배웁니다.
에이전트 정복을 위한 단 하나의 강의 👉🏻 https://nomadcoders.co/ai-agents-masterclass?utm_sourc…
그리곤 48시간도 안 돼서 클로드를 아예 안 열게 됐어.
-
💥 AI 패러다임의 핵심은 바로 '에이전트'입니다.
현 시점 최신 강의와 함께 AI 시대 변화의 흐름을 주도하세요
5개 프레임워크 × 10개 실전 위주 프로젝트로 AI Agents의 모든 것을 배웁니다.
에이전트 정복을 위한 단 하나의 강의 👉🏻 https://nomadcoders.co/ai-agents-masterclass?utm_sourc…
Forwarded from 해랑달의 Moneymoves
K 자형
진짜 양극화가 점점 더 심해지는게 너도 나도 가지고 싶은 초우량 자산 수익률이 나머지 모두를 압도하는 세상의 패러다임. 코인에서 미리 맛본거지만 그래도 참 그렇네....
주식, 부동산, 코인 모두 다 비슷합니다. 정보의 비대칭성이 없어져서 그런거 아닐까요? 좀 더 깊게 생각해보면 좋을 것 같은데 제가 대신 생각해드릴게요
https://economist.co.kr/article/view/ecn202605040036
진짜 양극화가 점점 더 심해지는게 너도 나도 가지고 싶은 초우량 자산 수익률이 나머지 모두를 압도하는 세상의 패러다임. 코인에서 미리 맛본거지만 그래도 참 그렇네....
주식, 부동산, 코인 모두 다 비슷합니다. 정보의 비대칭성이 없어져서 그런거 아닐까요? 좀 더 깊게 생각해보면 좋을 것 같은데 제가 대신 생각해드릴게요
https://economist.co.kr/article/view/ecn202605040036
이코노미스트
대형주만 질주하는 코스피…‘K자형’ 장세 속 벌어지는 수익률 격차
코스피가 7500고지를 넘어서는 등 사상 최고치를 연이어 경신하며 상승 랠리를 이어가고 있지만, 시장 내부에서는 종목 간 수익률 격차가 빠르게 벌어
Forwarded from 엄선된 준의 식견
Forwarded from Hodl crypto for 100y
🚨JUST IN: The Senate Banking Committee has released the new 309-page draft of the Clarity Act it’s been working on since January.
Source
Source
Forwarded from RWA 맛집: 자산 맛좀 볼래? (100y | Four Pillars)
클래리티 액트 최신 드래프트가 나왔습니다.
기존 버전에서 업데이트된 부분이 몇 개 있는데,
- 내부자 거래 관련 조항 추가
- 디파이 관련 조항: 중앙화/탈중앙화 여부를 실질적으로 판단할 예정
- 스테이블코인 이자 지급: 단순 보유로는 스테이블코인 이자 지급이 금지되고, 활동/트랜잭션 관련되어서만 보상 지급이 가능하다고 언급되어있네요.
이번주 목요일이 마크업회의라고 하니 조금 변동될 수는 있지만, 저희가 가장 관심있게 보는 스테이블코인 이자지급 관련은 단순 보유로는 직접 이자 지급이던 리워드로 우회해서 주던 이자 지급이 막힐 가능성이 높아보이기는하네요 😭
https://www.banking.senate.gov/imo/media/doc/ehf26374.pdf
기존 버전에서 업데이트된 부분이 몇 개 있는데,
- 내부자 거래 관련 조항 추가
- 디파이 관련 조항: 중앙화/탈중앙화 여부를 실질적으로 판단할 예정
- 스테이블코인 이자 지급: 단순 보유로는 스테이블코인 이자 지급이 금지되고, 활동/트랜잭션 관련되어서만 보상 지급이 가능하다고 언급되어있네요.
이번주 목요일이 마크업회의라고 하니 조금 변동될 수는 있지만, 저희가 가장 관심있게 보는 스테이블코인 이자지급 관련은 단순 보유로는 직접 이자 지급이던 리워드로 우회해서 주던 이자 지급이 막힐 가능성이 높아보이기는하네요 😭
https://www.banking.senate.gov/imo/media/doc/ehf26374.pdf