back

by teleforce·24d ago·view on hn ↗
>On this benchmark, a pure LLM generated an accuracy score of zero. Adding RAG, prompt engineering, and agentic AI raised accuracy to the 10+% range.

Oouch!