Wir freuen uns, die Veröffentlichung unseres neuen Fachartikels „Evaluating Large Language Models for RDF Knowledge Graph-Related Tasks—The LLM-KG-Bench-Framework 3“ bekanntzugeben. Der Beitrag von Lars-Peter Meyer, Johannes Frey und Michael Martin ist im Journal Semantic Web – Interoperability, Usability, Applicability erschienen.
Hierbei handeln es sich um eine aktuelle Zusammenfassung des Benchmarking-Frameworks, des großen Evaluationsdatensatz und eine Auswertung der SPARQL bezogenen Fähigkeiten.
Aktuelle Large Language Models (LLMs) können mit strukturierten Informationen arbeiten und sogar bei der Entwicklung von Programmcode helfen, aber können sie auch die Arbeit mit Wissensgraphen (KGs) unterstützen? Welches LLM bietet die besten Fähigkeiten im Bereich des Semantic Web und des Knowledge Graph Engineering (KGE)? Lässt sich dies feststellen, ohne viele Antworten manuell zu überprüfen? Das LLM-KG-Bench-Framework wurde entwickelt, um diese Fragen zu beantworten. Es besteht aus einer erweiterbaren Reihe von Aufgaben, für die die Antworten der LLMs automatisch ausgewertet werden, und deckt verschiedene Aspekte der Arbeit mit semantischen Technologien ab. Dieser Artikel beschreibt das LLM-KG-Bench-Framework, seine Hauptkonzepte und die implementierten Aufgaben. In einem Benchmark-Durchlauf wurde damit ein umfassender Datensatz generiert, mit dem mehr als 40 aktuelle offene und proprietäre LLMs anhand von 26 Benchmark-Aufgaben bewertet wurden. Das Ergebnis sind Interaktionsprotokolle und Auswertungen von rund 45 000 LLM-Aufgabendialogen. Schließlich wird dieser Datensatz für eine Analyse der SPARQL-bezogenen Fähigkeiten der getesteten LLMs verwendet.
Der Artikel ist hier zu lesen.