declanjackson
- Karma
- 7
- Created
- 9 months ago
Recent Submissions
- 1. ▲ Kimi K3 beats GPT 5.6 Sol in agentic knowledge work (artificialanalysis.ai)
- 2. ▲ GLM-5.2 is above GPT-5.5 in new agentic knowledge work eval (artificialanalysis.ai)
- 3. ▲ Show HN: AA-Briefcase: a frontier knowledge work evaluation (artificialanalysis.ai)
- 4. ▲ AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Language Models (arxiv.org)