Mario Marcolongo
Model behavior testing · adversarial QA · evidence-bound reporting · evaluation operations
AI evaluation and research-verification specialist with self-directed model-behavior testing across chat, image, agentic tool-use and indirect prompt-injection challenges. The Gray Swan Proving Ground profile displayed rank #74 (top 6%) and 113 total breaks on 29 July 2026. Supporting work demonstrates multilingual content quality, consumer-genomics privacy research, corporate-source reconciliation, archival source recovery, claim-to-source auditing and evidence-bound reporting across sensitive records.
Selected evidence
Relevant experience
Model-Behavior Evaluator
- Conduct self-directed testing of LLM instruction handling, policy boundaries and edge cases across chat, image, agentic tool-use and indirect prompt-injection settings.
- Reached #74 on the Proving Ground (top 6%) with 113 platform-displayed total breaks in the 29 July 2026 snapshot.
- Document the visible 112/113 discrepancy and separate platform-reported outcomes from independent verification, model-wide conclusions or security certification.
Scientific Content Quality & Operations Contractor
- Delivered 80 documented published content contributions: 55 YouTube videos · 4 articles · 21 short-form pieces.
- Conduct recurring primary-literature review, scientific fact-checking and English-to-Italian localization; adapt evidence into Italian scripts, visualizations and short-form content while preserving terminology, meaning and source context.
- Designed and built entropyforlife.it in WordPress; formally acknowledged in Giacomo Moro Mauretto's Mondadori book Italiani veri for scientific-literature research and error detection.