Leftshiftone
aws Digitalisierung | 2024 | AI Adoption | Steiermark
Entwicklung eines automatischen Testframeworks für LLM Fact-Checking
aws Digitalisierung | 2024 | AI Adoption | Steiermark
Das vorliegende Projekt zielt auf die Entwicklung eines automatisierten Testframeworks für Large Language Models (LLMs), das speziell zur Verbesserung der Vertrauenswürdigkeit und Effizienz von KI-Modellen dient. Unter Berücksichtigung der Anforderungen des EU AI Acts wird ein umfassendes Testsystem entwickelt, das eine End-to-End-Überprüfung der LLMs ermöglicht. Dies schließt die Überwachung auf Halluzinationen und die Sicherstellung der Übereinstimmung mit verifizierten Unternehmensdaten ein.
Das Framework erlaubt die automatische und manuelle Definition von Testfällen und ermöglicht eine schnelle Integration in bestehende Software-Pipelines. Durch die Kombination von quantitativen Methoden und fortgeschrittener Statistik wird die Testausführung optimiert, während gleichzeitig der Schutz der Datenschutz- und Sicherheitsanforderungen der EU, einschließlich der GDPR-Vorgaben, gewährleistet ist.
Die Zielsetzung des Projekts ist es, das Vertrauen der Anwender*innen in LLM-basierte Systeme zu erhöhen und die Entwicklung von KI-Modellen zu beschleunigen, indem alle relevanten Parameter, einschließlich Prompts, in einer umfassenden Testpipeline integriert werden. Dies schafft eine solide Grundlage für die Compliance und Transparenz von KI-Systemen und stellt sicher, dass die Ergebnisse den höchsten Standards entsprechen.
English: Development of an Automated Test Framework for LLM Fact-Checking
The aim of this project is to develop an automated test framework for Large Language Models (LLMs), specifically designed to enhance the trustworthiness and efficiency of AI models. Taking into account the requirements of the EU AI Act, a comprehensive testing system will be developed that enables end-to-end verification of LLMs. This includes monitoring for hallucinations and ensuring compliance with verified corporate data. The framework allows for both automatic and manual definition of test cases and facilitates quick integration into existing software pipelines. By combining quantitative methods with advanced statistics, test execution is optimized, while ensuring the protection of privacy and security requirements of the EU, including GDPR regulations. The project's goal is to increase user trust in LLM-based systems and accelerate the development of AI models by integrating all relevant parameters, including prompts, into a comprehensive testing pipeline. This creates a solid foundation for compliance and transparency of AI systems and ensures that the results meet the highest standards.


