Grafendatabaseprovider Neo4j stelt dat grafentechnologie AI-modellen en -agenten kan voorkomen van het genereren van hallucinaties, fabricaties en valse antwoorden op gebruikersvragen.
Het bedrijf verwees naar een recent academisch paper dat in juni op arXiv werd gepubliceerd, getiteld “Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation”, dat de claim valideert.
Het abstract van het paper merkt op dat de studie het adopteren van een lichtgewicht graafstructuur met een eenvoudig graafschema onderzoekt om het RAG (Retrieval-Augmented Generation) subsysteem te ondersteunen via een speciale toolset. Het onderzoeksteam bouwde een agent-systeem uitgerust met diverse vectorzoek- en graafquerytools, opererend op gestructureerde gegevens afkomstig van gecureerde Engelse Wikipedia-artikelen. Het evalueerde de systeemprestaties op complexe vragen uit MoNaCo, een uitdagende Wikipedia QA-benchmark voor complexe query-antwoordsystemen.
De onderzoekers stelden een complexe vraag voor aan LLM's: “Kunt u alle veldslagen tussen de Nederlanders en de Engelsen in de Eerste, Tweede en Derde Anglo-Nederlandse Oorlogen noemen, en de winnaar van elke slag opsommen?”
Het beantwoorden van deze vraag vereist geavanceerde retrieval- en redeneervermogens, waaronder gelijktijdige multi-entiteit, multi-hop redenering en cross-document toegang. De studie wijst erop dat dergelijke complexe vragen grote uitdagingen vormen voor de huidige state-of-the-art LLM-gebaseerde systemen.
Het team testte de vraag op drie LLM-opstellingen en analyseerde de resultaten:
1. Vector+graaf RAG: Gebruikt een uniforme vector- en graafdatabase met vooraf gedefinieerde tools om de retrieval van externe kennisbanken te optimaliseren.
2. Eenvoudige vector RAG
3. Zero-shot LLM zonder RAG-verbetering
De bevindingen van het paper bevestigen dat het integreren van een basale graafgebaseerde kennisbank en bijpassende tools in standaard vector RAG AI-hallucinaties aanzienlijk kan verminderen, hoewel het ze niet volledig kan elimineren. De grove waarheidsgetrouwheidsscore verbeterde van ongeveer −127 voor zero-shot LLM's naar −49 voor vector+graaf RAG.
Bovendien presteert de hybride aanpak significant beter dan standalone vector RAG. Wanneer gedeeltelijk correcte antwoorden worden meegenomen in de evaluatie, behaalt vector+graaf RAG de hoogste score van de drie testscenario's. De fijnmazige waarheidsgetrouwheidsscore is 80 procent hoger dan die van pure vector RAG, met feitelijke precisie en recall meer dan dubbel die van het puur vector RAG-systeem.
Over het algemeen verbetert de voorgestelde oplossing zowel precisie als recall, terwijl hallucinaties worden ingeperkt, en biedt het een haalbaar pad om de betrouwbaarheid en geloofwaardigheid van LLM-gebaseerde QA-systemen te verbeteren.
Lees het originele paper voor uitgebreide technische details van het onderzoek.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Global Strategy Director
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Website: www.qianxingdata.com/www.storagesserver.com
Zakelijke focus:
ICT Productdistributie/Systeemintegratie & Services/Infrastructuuroplossingen
Met meer dan 20 jaar ervaring in IT-distributie werken we samen met toonaangevende wereldwijde merken om betrouwbare producten en professionele diensten te leveren.
“Technologie gebruiken om een intelligente wereld te bouwen”Uw Betrouwbare ICT Product Service Provider!