Skip to content

auto: new LLM security papers (run #17) - #48

Open
github-actions[bot] wants to merge 1 commit into
mainfrom
auto/papers-17
Open

auto: new LLM security papers (run #17)#48
github-actions[bot] wants to merge 1 commit into
mainfrom
auto/papers-17

Conversation

@github-actions

Copy link
Copy Markdown
Contributor

Automated Paper Fetch

New papers discovered from arXiv, Semantic Scholar, and CrossRef.

All entries are marked reviewed: false -- please review before merging.

New Entries

--- New Entries ---
- [llmsec-2026-00206] Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation
  https://arxiv.org/abs/2607.14493
  Categories: prompt-injection
- [llmsec-2026-00207] PVDetector: Detecting Prompt Injection Attacks on Purpose-Specific LLM Agents through Policy-Violation Concept Analysis
  https://arxiv.org/abs/2607.12624
  Categories: prompt-injection, guardrails
- [llmsec-2026-00208] Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls
  https://arxiv.org/abs/2607.09076
  Categories: agentic-threats, monitoring-detection
- [llmsec-2026-00209] When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents
  https://arxiv.org/abs/2607.06595
  Categories: memory-security
- [llmsec-2026-00210] Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning
  https://arxiv.org/abs/2607.01138
  Categories: agentic-threats
- [llmsec-2026-00211] A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems
  https://arxiv.org/abs/2606.31639
  Categories: autonomous-operations, survey
- [llmsec-2026-00212] Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback
  https://arxiv.org/abs/2606.29700
  Categories: benchmarks
- [llmsec-2026-00213] An Empirical Evaluation of Prompt Injection Vulnerabilities in Large Language Models Across Multilingual and Obfuscated Attack Scenarios
  https://arxiv.org/abs/2606.29602
  Categories: prompt-injection
- [llmsec-2026-00214] Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering
  https://arxiv.org/abs/2606.29030
  Categories: tool-use-security
- [llmsec-2026-00215] FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks
  https://arxiv.org/abs/2606.28962
  Categories: data-poisoning
- [llmsec-2026-00216] RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots
  https://arxiv.org/abs/2606.28649
  Categories: prompt-injection
- [llmsec-2026-00217] Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models
  https://arxiv.org/abs/2606.28153
  Categories: jailbreaking, guardrails
- [llmsec-2026-00218] LLM agents security duality: a comprehensive survey of self-security and empowered cybersecurity
  https://arxiv.org/abs/2606.28450
  Categories: survey
- [llmsec-2026-00219] Representation Matters: An Empirical Study of Program Representations for LLM Vulnerability Reasoning
  https://arxiv.org/abs/2606.25356
  Categories: benchmarks
- [llmsec-2026-00220] HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice
  https://arxiv.org/abs/2606.24819
  Categories: benchmarks
- [llmsec-2026-00221] Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees
  https://arxiv.org/abs/2606.24322
  Categories: memory-security
- [llmsec-2026-00222] Evaluating LLMs for Real-World Web Vulnerability Detection
  https://arxiv.org/abs/2606.21397
  Categories: benchmarks
- [llmsec-2026-00223] Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer
  https://arxiv.org/abs/2606.21071
  Categories: prompt-injection
- [llmsec-2026-00224] Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers
  https://arxiv.org/abs/2606.21037
  Categories: benchmarks
- [llmsec-2026-00225] Calibration Without Comprehension: Diagnosing the Limits of Fine-Tuning LLMs for Vulnerability Detection in Systems Software
  https://arxiv.org/abs/2606.20502
  Categories: benchmarks
- [llmsec-2026-00226] Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
  https://arxiv.org/abs/2607.14611
  Categories: prompt-injection, agentic-threats, sandboxing-isolation
- [llmsec-2026-00227] Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation
  https://arxiv.org/abs/2607.13987
  Categories: prompt-injection, threat-modeling
- [llmsec-2026-00228] How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement
  https://arxiv.org/abs/2607.13718
  Categories: prompt-injection, agentic-threats, access-control
- [llmsec-2026-00229] Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels
  https://arxiv.org/abs/2607.12792
  Categories: jailbreaking, benchmarks
- [llmsec-2026-00230] Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak
  https://arxiv.org/abs/2607.14147
  Categories: jailbreaking
- [llmsec-2026-00231] SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification
  https://arxiv.org/abs/2607.13081
  Categories: prompt-injection, agentic-threats, guardrails, benchmarks
- [llmsec-2026-00232] Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud
  https://arxiv.org/abs/2607.10712
  Categories: data-poisoning
- [llmsec-2026-00233] NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations
  https://arxiv.org/abs/2607.10490
  Categories: prompt-injection, benchmarks, tool-use-security
- [llmsec-2026-00234] Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices
  https://arxiv.org/abs/2607.10269
  Categories: prompt-injection
- [llmsec-2026-00235] Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety
  https://arxiv.org/abs/2607.10112
  Categories: jailbreaking, guardrails, benchmarks
- [llmsec-2026-00236] Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models
  https://arxiv.org/abs/2607.08282
  Categories: agent-architecture
- [llmsec-2026-00237] Prismata: Confining Cross-Site Prompt Injection in Web Agents
  https://arxiv.org/abs/2607.08147
  Categories: prompt-injection
- [llmsec-2026-00238] Efficient Safety Alignment of Language Models via Latent Personality Traits
  https://arxiv.org/abs/2607.07918
  Categories: adversarial-examples, guardrails
- [llmsec-2026-00239] Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
  https://arxiv.org/abs/2607.07903
  Categories: jailbreaking, adversarial-examples
- [llmsec-2026-00240] Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild
  https://arxiv.org/abs/2607.07827
  Categories: jailbreaking
- [llmsec-2026-00241] Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting
  https://arxiv.org/abs/2607.07433
  Categories: prompt-injection, agentic-threats, threat-modeling
- [llmsec-2026-00242] Untrusted Content Masking for Web Agents with Security Guarantees
  https://arxiv.org/abs/2607.05277
  Categories: prompt-injection
- [llmsec-2026-00243] Agent Data Injection Attacks are Realistic Threats to AI Agents
  https://arxiv.org/abs/2607.05120
  Categories: prompt-injection, agentic-threats
- [llmsec-2026-00244] DualView: Preventing Indirect Prompt Injection in Personal AI Agents
  https://arxiv.org/abs/2607.03821
  Categories: prompt-injection
- [llmsec-2026-00245] Overloading Large Vision-Language Models for Jailbreaking
  https://arxiv.org/abs/2607.02961
  Categories: jailbreaking
- [llmsec-2026-00246] HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment
  https://arxiv.org/abs/2607.00572
  Categories: jailbreaking, guardrails
- [llmsec-2026-00247] Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
  https://arxiv.org/abs/2607.00481
  Categories: jailbreaking
- [llmsec-2026-00248] Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
  https://arxiv.org/abs/2606.31227
  Categories: red-teaming
- [llmsec-2026-00249] Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense
  https://arxiv.org/abs/2606.30783
  Categories: prompt-injection, benchmarks
- [llmsec-2026-00250] Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens
  https://arxiv.org/abs/2606.30755
  Categories: agentic-threats, benchmarks
- [llmsec-2026-00251] Forensic Trajectory Signatures for Agent Memory Poisoning Detection
  https://arxiv.org/abs/2606.30566
  Categories: memory-security
- [llmsec-2026-00252] On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models
  https://arxiv.org/abs/2606.27567
  Categories: prompt-injection, access-control
- [llmsec-2026-00253] Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries
  https://arxiv.org/abs/2606.26936
  Categories: jailbreaking
- [llmsec-2026-00254] MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
  https://arxiv.org/abs/2606.26793
  Categories: prompt-injection, agentic-threats, red-teaming, benchmarks
- [llmsec-2026-00255] Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents
  https://arxiv.org/abs/2606.26627
  Categories: survey
- [llmsec-2026-00256] Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
  https://arxiv.org/abs/2606.26566
  Categories: jailbreaking, benchmarks, survey, threat-modeling
- [llmsec-2026-00257] Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
  https://arxiv.org/abs/2606.26479
  Categories: prompt-injection, benchmarks
- [llmsec-2026-00258] RAS: Measuring LLM Safety Through Refusal Alignment
  https://arxiv.org/abs/2606.25750
  Categories: jailbreaking, guardrails
- [llmsec-2026-00259] How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
  https://arxiv.org/abs/2606.25487
  Categories: prompt-injection, jailbreaking
- [llmsec-2026-00260] PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
  https://arxiv.org/abs/2606.24081
  Categories: jailbreaking, benchmarks
- [llmsec-2026-00261] TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization
  https://arxiv.org/abs/2606.23496
  Categories: jailbreaking, red-teaming
- [llmsec-2026-00262] Detecting Malicious Agent Skills in the Wild using Attention
  https://arxiv.org/abs/2606.23416
  Categories: agentic-threats
- [llmsec-2026-00263] DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings
  https://arxiv.org/abs/2606.22779
  Categories: prompt-injection, adversarial-examples
- [llmsec-2026-00264] The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs
  https://arxiv.org/abs/2606.22686
  Categories: guardrails
- [llmsec-2026-00265] Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift
  https://arxiv.org/abs/2606.22659
  Categories: benchmarks
- [llmsec-2026-00266] Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents
  https://arxiv.org/abs/2606.21732
  Categories: prompt-injection
- [llmsec-2026-00267] Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity
  https://arxiv.org/abs/2607.01153
  Categories: agentic-threats, benchmarks
- [llmsec-2026-00268] Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
  https://arxiv.org/abs/2606.27632
  Categories: tool-use-security
- [llmsec-2026-00269] MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety
  https://arxiv.org/abs/2606.02630
  Categories: jailbreaking, adversarial-examples
- [llmsec-2026-00270] AI Security Research Should Better Incentivize Defense Research
  https://arxiv.org/abs/2605.23448
  Categories: membership-inference, federated-learning
- [llmsec-2026-00271] The Poisoned Chalice of LLM Evaluation Report
  https://arxiv.org/abs/2607.07481
  Categories: benchmarks
- [llmsec-2026-00272] ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models
  https://arxiv.org/abs/2607.00361
  Categories: data-poisoning
- [llmsec-2026-00273] Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models
  https://arxiv.org/abs/2606.30899
  Categories: data-poisoning
- [llmsec-2026-00274] Theory of Continual Learning Against Data Poisoning Attacks
  https://arxiv.org/abs/2606.29841
  Categories: data-poisoning
- [llmsec-2026-00275] Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare
  https://arxiv.org/abs/2606.28666
  Categories: agentic-threats
- [llmsec-2026-00276] When the Aggregator Cheats: Data-Free Backdoors in Federated LLM-based QA Systems
  https://arxiv.org/abs/2606.27511
  Categories: federated-learning
- [llmsec-2026-00277] Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
  https://arxiv.org/abs/2606.26036
  Categories: data-poisoning
- [llmsec-2026-00278] Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory
  https://arxiv.org/abs/2606.25115
  Categories: agentic-threats
- [llmsec-2026-00279] LLM-Based Scientific Peer Review: Methods, Benchmarks, and Reliability Challenges
  https://arxiv.org/abs/2606.25057
  Categories: benchmarks, survey
- [llmsec-2026-00280] When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense
  https://arxiv.org/abs/2606.22030
  Categories: benchmarks
- [llmsec-2026-00281] Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning
  https://arxiv.org/abs/2606.20922
  Categories: prompt-injection
- [llmsec-2026-00282] A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots
  https://arxiv.org/abs/2606.19660
  Categories: prompt-injection, input-filtering
- [llmsec-2026-00283] SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents
  https://arxiv.org/abs/2606.18356
  Categories: agentic-threats, sandboxing-isolation, benchmarks
- [llmsec-2026-00284] The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
  https://arxiv.org/abs/2606.12797
  Categories: agentic-threats
- [llmsec-2026-00285] Securing Code Understanding: Detecting Natural Backdoor Vulnerability in Code Language Models
  https://arxiv.org/abs/2606.10846
  Categories: data-poisoning
- [llmsec-2026-00286] MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents
  https://arxiv.org/abs/2606.10742
  Categories: memory-security
- [llmsec-2026-00287] Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs
  https://arxiv.org/abs/2606.10322
  Categories: agent-architecture
- [llmsec-2026-00288] Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks
  https://arxiv.org/abs/2606.07970
  Categories: adversarial-examples, guardrails
- [llmsec-2026-00289] Steering Vectors are an Adversarial Attack Surface
  https://arxiv.org/abs/2606.05958
  Categories: jailbreaking, data-poisoning, adversarial-examples
- [llmsec-2026-00290] Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense
  https://arxiv.org/abs/2606.05743
  Categories: jailbreaking, guardrails
- [llmsec-2026-00291] Patcher: Post-Hoc Patching of Backdoored Large Language Models
  https://arxiv.org/abs/2606.02995
  Categories: jailbreaking, data-poisoning, guardrails
- [llmsec-2026-00292] BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks
  https://arxiv.org/abs/2606.02947
  Categories: data-poisoning
- [llmsec-2026-00293] Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction
  https://arxiv.org/abs/2605.29960
  Categories: memory-security
- [llmsec-2026-00294] When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries
  https://arxiv.org/abs/2606.28332
  Categories: guardrails, benchmarks
- [llmsec-2026-00295] Cordyceps: Covert Control Attacks on LLMs via Data Poisoning
  https://arxiv.org/abs/2605.26595
  Categories: data-poisoning, monitoring-detection
- [llmsec-2026-00296] GradSentry: Gradient Spectral Entropy for Backdoor Sample Filtering in Large Language Model Fine-Tuning
  https://arxiv.org/abs/2605.26574
  Categories: data-poisoning
- [llmsec-2026-00297] Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures
  https://arxiv.org/abs/2605.25435
  Categories: autonomous-operations
- [llmsec-2026-00298] Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
  https://arxiv.org/abs/2605.25073
  Categories: data-poisoning, fine-tuning-security, survey
- [llmsec-2026-00299] When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents
  https://arxiv.org/abs/2605.24069
  Categories: benchmarks
- [llmsec-2026-00300] Backdooring Masked Diffusion Language Models
  https://arxiv.org/abs/2605.19262
  Categories: data-poisoning
- [llmsec-2026-00301] Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
  https://arxiv.org/abs/2605.19147
  Categories: data-poisoning
- [llmsec-2026-00302] Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks
  https://arxiv.org/abs/2605.18988
  Categories: agentic-threats, guardrails, autonomous-operations
- [llmsec-2026-00303] Not What You Asked For: Typographic Attacks in Household Robot Manipulation
  https://arxiv.org/abs/2605.18593
  Categories: benchmarks
- [llmsec-2026-00304] OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
  https://arxiv.org/abs/2605.18930
  Categories: agentic-threats
- [llmsec-2026-00305] Hidden in Memory: Sleeper Memory Poisoning in LLM Agents
  https://arxiv.org/abs/2605.15338
  Categories: memory-security
- [llmsec-2026-00306] Ground-Side Mission Plan Compilation with Policy-as-Code Guardrails for Cloud-Native Satellite Platforms
  https://arxiv.org/abs/2607.14798
  Categories: guardrails
- [llmsec-2026-00307] Democratizing Agent Deployment Safety: A Structural Monitoring Approach
  https://arxiv.org/abs/2607.14570
  Categories: monitoring-detection
- [llmsec-2026-00308] Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration
  https://arxiv.org/abs/2607.12662
  Categories: agentic-threats
- [llmsec-2026-00309] Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing
  https://arxiv.org/abs/2607.12619
  Categories: agentic-threats, autonomous-operations
- [llmsec-2026-00310] Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects
  https://arxiv.org/abs/2607.12068
  Categories: benchmarks
- [llmsec-2026-00311] Mako: A Self-Evolving Agentic Operating System (SE-AOS) for Autonomous Web Exploitation
  https://arxiv.org/abs/2607.11288
  Categories: agentic-threats
- [llmsec-2026-00312] VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
  https://arxiv.org/abs/2607.09653
  Categories: agent-architecture
- [llmsec-2026-00313] SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets
  https://arxiv.org/abs/2607.08681
  Categories: agentic-threats, benchmarks, autonomous-operations
- [llmsec-2026-00314] Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
  https://arxiv.org/abs/2607.08066
  Categories: jailbreaking, monitoring-detection
- [llmsec-2026-00315] Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety
  https://arxiv.org/abs/2607.07695
  Categories: red-teaming, benchmarks, agent-architecture
- [llmsec-2026-00316] Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
  https://arxiv.org/abs/2607.07368
  Categories: agent-architecture
- [llmsec-2026-00317] Security and Privacy in Agentic AI: Grand Challenges and Future Directions
  https://arxiv.org/abs/2607.06608
  Categories: agentic-threats
- [llmsec-2026-00318] The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities
  https://arxiv.org/abs/2607.05743
  Categories: access-control, sandboxing-isolation, human-in-the-loop
- [llmsec-2026-00319] aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents
  https://arxiv.org/abs/2607.05518
  Categories: access-control
- [llmsec-2026-00320] LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems
  https://arxiv.org/abs/2607.09756
  Categories: agentic-threats, monitoring-detection
- [llmsec-2026-00321] CAGE-1: Control, Assurance, and Governance Evaluation for Enterprise Agentic AI
  https://arxiv.org/abs/2607.03510
  Categories: agentic-threats
- [llmsec-2026-00322] Securing Multi-Tool AI Agent Chains With Dynamic, Real-Time Compositional Policies
  https://arxiv.org/abs/2607.03423
  Categories: guardrails
- [llmsec-2026-00323] Agentic-SecPBFT: Agentic AI-Driven Proactive Security Framework for Wireless PBFT Consensus in Mobile Ad-Hoc Networks
  https://arxiv.org/abs/2607.03269
  Categories: agentic-threats
- [llmsec-2026-00324] Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
  https://arxiv.org/abs/2607.02376
  Categories: agentic-threats
- [llmsec-2026-00325] Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support
  https://arxiv.org/abs/2607.02245
  Categories: agent-architecture
- [llmsec-2026-00326] Janus: a Playground for User-Involved Agentic Permission Management
  https://arxiv.org/abs/2607.01510
  Categories: agentic-threats
- [llmsec-2026-00327] An Agentic AI Framework to Accelerate Scientific Discovery in Plant Phenotyping
  https://arxiv.org/abs/2606.31831
  Categories: agentic-threats
- [llmsec-2026-00328] Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems
  https://arxiv.org/abs/2606.31339
  Categories: agentic-threats
- [llmsec-2026-00329] Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems
  https://arxiv.org/abs/2606.28425
  Categories: agentic-threats, agent-architecture, tool-use-security, autonomous-operations
- [llmsec-2026-00330] The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems
  https://arxiv.org/abs/2606.26057
  Categories: output-moderation, guardrails, access-control
- [llmsec-2026-00331] Identity Management for Agentic AI: The new frontier of authorization, authentication, and security for an AI agent world
  https://www.semanticscholar.org/paper/c482e9aa341ecd5dbf545aa16df9c6815aa55650
  Categories: agentic-threats, access-control, autonomous-operations
- [llmsec-2026-00332] TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems
  https://www.semanticscholar.org/paper/753736d18fa9bf3ed730836b30b89bf5653cd8dd
  Categories: agentic-threats, agent-architecture
- [llmsec-2026-00333] SAGA: A Security Architecture for Governing AI Agentic Systems
  https://www.semanticscholar.org/paper/643e64fd77cb9a2b2defd63769af75a92365a6c7
  Categories: agentic-threats, access-control
- [llmsec-2026-00334] Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems
  https://www.semanticscholar.org/paper/fa748fc17c5e7506bf3fed331e81b2011e5039d0
  Categories: agentic-threats, autonomous-operations
- [llmsec-2026-00335] Agentic AI for 6G: A New Paradigm for Autonomous RAN Security Compliance
  https://www.semanticscholar.org/paper/3db949389086da9db5ec5e9fc88c1de41ee99df2
  Categories: agentic-threats
- [llmsec-2026-00336] ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
  https://www.semanticscholar.org/paper/37c56b578604d3dea4d86ae9bf1a76cdbff5129e
  Categories: prompt-injection, agentic-threats, threat-modeling
- [llmsec-2026-00337] Security Analysis of Agentic AI Communication Protocols: A Comparative Evaluation
  https://www.semanticscholar.org/paper/a380e368fc630cdeab758fa86959a7570024a7a3
  Categories: agentic-threats, benchmarks, agent-architecture
- [llmsec-2026-00338] Agentic AI for Autonomous Defense in Software Supply Chain Security: Beyond Provenance to Vulnerability Mitigation
  https://www.semanticscholar.org/paper/7ef12e7f28b538a044f3b2c2af4160446723a200
  Categories: supply-chain-attacks, agentic-threats
- [llmsec-2026-00339] AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security
  https://www.semanticscholar.org/paper/8f66f06304829890f83c428fb4677a54c91d9fbd
  Categories: agentic-threats, guardrails, tool-use-security
- [llmsec-2026-00340] AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security
  https://www.semanticscholar.org/paper/27d50468f1016b18c07283b56ea5dc0f5479b980
  Categories: guardrails
- [llmsec-2026-00341] A Research Landscape of Agentic AI and Large Language Models: Applications, Challenges and Future Directions
  https://www.semanticscholar.org/paper/24ae03b3f1793dc2ca5aec06ed4c50ec61a6c7cd
  Categories: agentic-threats
- [llmsec-2026-00342] Building A Secure Agentic AI Application Leveraging Google’s A2A Protocol
  https://www.semanticscholar.org/paper/8f3fc962d61ac1d298ed511ba27272f1c5991599
  Categories: agentic-threats, agent-architecture
- [llmsec-2026-00343] A Novel Zero-Trust Identity Framework for Agentic AI: Decentralized Authentication and Fine-Grained Access Control
  https://www.semanticscholar.org/paper/2bbf1fc0d7bce53edbfcaeb81143c1233c074923
  Categories: agentic-threats, access-control
- [llmsec-2026-00344] Trustworthy agentic AI systems: a cross-layer review of architectures, threat models, and governance strategies for real-world deployment
  https://www.semanticscholar.org/paper/b4578b31671f32a11e47b0f4870b885f55900153
  Categories: agentic-threats, threat-modeling
- [llmsec-2026-00345] Agent-Based AI Approach to Security in IoT Systems Leveraging Genai
  https://www.semanticscholar.org/paper/6f1174d046152d8270662e216a28d82016aed238
  Categories: agentic-threats
- [llmsec-2026-00346] Sola-Visibility-ISPM: Benchmarking Agentic AI for Identity Security Posture Management Visibility
  https://www.semanticscholar.org/paper/ec53bf26de1b0055611062408c1116f35cd308e7
  Categories: agentic-threats, benchmarks
- [llmsec-2026-00347] Oversight Structures for Agentic AI in Public-Sector Organizations
  https://www.semanticscholar.org/paper/f28ed25afc2d23d9d62e0766b2956d142bb9913a
  Categories: agentic-threats
- [llmsec-2026-00348] Formal Analysis and Supply Chain Security for Agentic AI Skills
  https://www.semanticscholar.org/paper/d6665127102362bd5060d673a21fe6b1de3f376c
  Categories: supply-chain-attacks, agentic-threats
- [llmsec-2026-00349] Security in the Age of AI Teammates: An Empirical Study of Agentic Pull Requests on GitHub
  https://www.semanticscholar.org/paper/53ed867f0c124539c1521dec5d052779cb8a0f2a
  Categories: agentic-threats
- [llmsec-2026-00350] Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
  https://www.semanticscholar.org/paper/e7ce3289d680295e57dc66ad0563924e2006cd3a
  Categories: agentic-threats, tool-use-security, survey
- [llmsec-2026-00351] AgentRiskBOM: A Risk-Scoping Security Bill of Materials for Agentic AI Systems
  https://www.semanticscholar.org/paper/4e4919e0bc5033dbccb1e837605d0762cb769f00
  Categories: agentic-threats, human-in-the-loop
- [llmsec-2026-00352] Human Society-Inspired Approaches to Agentic AI Security: The 4C Framework
  https://www.semanticscholar.org/paper/20f1c57301375e2642fd4969713acdf7c20177b6
  Categories: agentic-threats
- [llmsec-2026-00353] AGENTIC AI AND CYBER SECURITY: AUTONOMOUS THREAT HUNTING, INTRUSION DETECTION, AND ADAPTIVE DEFENSE MECHANISMS IN A WORLD OF INCREASINGLY SOPHISTICATED CYBER ATTACKS
  https://www.semanticscholar.org/paper/341d785475da2663203fc3ccaa1bca71968310bb
  Categories: agentic-threats
- [llmsec-2026-00354] Automating Organizational Cyber Security Policy Compliance Against Industry Standards Using Agentic AI
  https://www.semanticscholar.org/paper/b675c553acbc44d29e06bb0c8155978a0cbf73c7
  Categories: agentic-threats, audit-assurance
- [llmsec-2026-00355] Sentinel Agents for Secure and Trustworthy Agentic AI in Multi-Agent Systems
  https://www.semanticscholar.org/paper/296c6954e9fe7e5b48fe2dfadc6a23b4310b1bab
  Categories: agentic-threats, monitoring-detection, agent-architecture
- [llmsec-2026-00356] Securing Agentic AI: Threat Modeling and Risk Analysis for Network Monitoring Agentic AI System
  https://www.semanticscholar.org/paper/f42a56937c1a50380c6143ba835efa5b97c5c31e
  Categories: agentic-threats, monitoring-detection, autonomous-operations, threat-modeling
- [llmsec-2026-00357] Security Risks of Agentic Vehicles: A Systematic Analysis of Cognitive and Cross-Layer Threats
  https://www.semanticscholar.org/paper/af6ea3b929b3a1aba976f3d48d2c6d040968e7e0
  Categories: agentic-threats
- [llmsec-2026-00358] QSAF: A Novel Mitigation Framework for Cognitive Degradation in Agentic AI
  https://www.semanticscholar.org/paper/c3da993174d74465fbb632f2d3de5c31d8b58a26
  Categories: prompt-injection, agentic-threats
- [llmsec-2026-00359] Agent Security is a Systems Problem
  https://www.semanticscholar.org/paper/44d178dd44370773c5d0536025c8c848febcee9b
  Categories: agentic-threats
- [llmsec-2026-00360] In-Browser LLM-Guided Fuzzing for Real-Time Prompt Injection Testing in Agentic AI Browsers
  https://www.semanticscholar.org/paper/8b9011b256c4819d47721efc3f9522a721b92735
  Categories: prompt-injection, agentic-threats
- [llmsec-2026-00361] MobiLLM: An Agentic AI Framework for Closed-Loop Threat Mitigation in 6G Open RANs
  https://www.semanticscholar.org/paper/3fb886ee2cfed48af9dd1766725f0385754e5528
  Categories: agentic-threats
- [llmsec-2026-00362] The Evolution of Agentic AI in Cybersecurity: From Single LLM Reasoners to Multi-Agent Systems and Autonomous Pipelines
  https://www.semanticscholar.org/paper/6417c2e047247e4e844c8ab390fb3812fb4f80e1
  Categories: agentic-threats, agent-architecture
- [llmsec-2026-00363] Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems
  https://www.semanticscholar.org/paper/7e92cdb5bab66d182dd0abda4ce6bb8ccf8b75cf
  Categories: agentic-threats, benchmarks
- [llmsec-2026-00364] Securing Generative AI Agentic Workflows: Risks, Mitigation, and a Proposed Firewall Architecture
  https://www.semanticscholar.org/paper/783db6d7e129f598539e38b4608dfec1702c0eb1
  Categories: agentic-threats, agent-architecture
- [llmsec-2026-00365] AgentCyTE: Leveraging Agentic AI to Generate Cybersecurity Training & Experimentation Scenarios
  https://www.semanticscholar.org/paper/b89b1dc9130393a3c3d31d59f31897323f73d7eb
  Categories: agentic-threats
- [llmsec-2026-00366] PromptStudio: A Governance-Aware Agentic AI Framework for Automated Prompt Generation, Optimization, Evaluation, and Lifecycle Management
  https://doi.org/10.22214/ijraset.2026.84092
  Categories: agentic-threats
- [llmsec-2026-00367] Auto-Devops GPT: An Agentic AI Framework for Self-Healing CI/CD Pipelines Using LLM-Based Root Cause Analysis and Reinforcement Learning
  https://doi.org/10.22214/ijraset.2026.84056
  Categories: agentic-threats
- [llmsec-2026-00368] CIVIL AND CRIMINAL LIABILITY OF DEEPFAKE AI PLATFORM PROVIDERS IN VIOLATIONS OF THE RIGHT TO REPUTATION
  https://doi.org/10.71131/0rqvry57
  Categories: social-engineering

Generated by the weekly paper fetch workflow (run #17, trigger: schedule).

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant