Neuer Journalartikel: LLM-KG-Bench-Framework für die Evaluation von Large Language Models im Knowledge-Graph-Umfeld 

Wir freuen uns, die Veröf­fentlichung unseres neuen Fachar­tikels „Eval­u­at­ing Large Lan­guage Mod­els for RDF Knowl­edge Graph-Relat­ed Tasks—The LLM-KG-Bench-Frame­work 3“ bekan­ntzugeben. Der Beitrag von Lars-Peter Mey­er, Johannes Frey und Michael Mar­tin ist im Jour­nal Seman­tic Web – Inter­op­er­abil­i­ty, Usabil­i­ty, Applic­a­bil­i­ty erschienen. 

Hier­bei han­deln es sich um eine aktuelle Zusam­men­fas­sung des Bench­mark­ing-Frame­works, des großen Eval­u­a­tions­daten­satz und eine Auswer­tung der SPARQL bezo­ge­nen Fähigkeiten. 

Aktuelle Large Lan­guage Mod­els (LLMs) kön­nen mit struk­turi­erten Infor­ma­tio­nen arbeit­en und sog­ar bei der Entwick­lung von Pro­gramm­code helfen, aber kön­nen sie auch die Arbeit mit Wis­sens­graphen (KGs) unter­stützen? Welch­es LLM bietet die besten Fähigkeit­en im Bere­ich des Seman­tic Web und des Knowl­edge Graph Engi­neer­ing (KGE)? Lässt sich dies fest­stellen, ohne viele Antworten manuell zu über­prüfen? Das LLM-KG-Bench-Frame­work wurde entwick­elt, um diese Fra­gen zu beant­worten. Es beste­ht aus ein­er erweit­er­baren Rei­he von Auf­gaben, für die die Antworten der LLMs automa­tisch aus­gew­ertet wer­den, und deckt ver­schiedene Aspek­te der Arbeit mit seman­tis­chen Tech­nolo­gien ab. Dieser Artikel beschreibt das LLM-KG-Bench-Frame­work, seine Haup­tkonzepte und die imple­men­tierten Auf­gaben. In einem Bench­mark-Durch­lauf wurde damit ein umfassender Daten­satz gener­iert, mit dem mehr als 40 aktuelle offene und pro­pri­etäre LLMs anhand von 26 Bench­mark-Auf­gaben bew­ertet wur­den. Das Ergeb­nis sind Inter­ak­tion­spro­tokolle und Auswer­tun­gen von rund 45 000 LLM-Auf­gaben­di­alo­gen. Schließlich wird dieser Daten­satz für eine Analyse der SPAR­QL-bezo­ge­nen Fähigkeit­en der getesteten LLMs verwendet. 

Der Artikel ist hier zu lesen.