fadimerbay/multimodal-security-analysis
0
๐ Multimodal Security Analysis System
Context-Aware Multimodal Fusion for Intelligent Threat Detection
This project implements a multimodal security threat assessment system combining:
- ๐ผ๏ธ Visual Analysis (YOLOv8n object detection)
- ๐ Audio Analysis (Whisper speech recognition)
- ๐ฅ Temporal Analysis (Video motion tracking)
- ๐ง LLM Reasoning (Ollama/Rule-based fusion)
๐ Features
- Real-time multimodal analysis
- Frame-by-frame video processing
- Cross-modal threat correlation
- Confidence-based threat scoring
- Streamlit web interface
๐ Architecture
Image/Video + Audio โ Encoders โ Multimodal Fusion โ LLM Reasoning โ Threat Assessment๐ Academic Context
Master's Thesis Project (2025) Topic: Multimodal Large Language Models for Security Applications
โ๏ธ Models Used
- YOLO: yolov8n (11MB) - Object detection
- Whisper: base (142MB) - Speech recognition
- LLM: Ollama (local) / Rule-based reasoning
๐ Note
This deployment uses Rule-based reasoning due to Hugging Face resource constraints. Full LLM-based reasoning (Ollama) is available for local deployment.
