Research

Publications

Work on computer-use agents, autonomous evaluation, vision-language models, Ukrainian NLP, and accessible interfaces.

2026

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

Marta Sumyk, Oleksandr Kosovan

2026

arXiv preprint

Introduces a noise-corrected reward estimator that enables reinforcement learning from imperfect vision-language evaluator feedback across desktop-agent benchmarks.

Layer-Resolved Optimal Transport for Hallucination Detection in NMT and Abstractive Summarization

Mariia Onyshchuk, Maksym-Vasyl Tarnavskyi, Marta Sumyk

2026

ICML 2026 Mechanistic Interpretability Workshop

Studies layer-wise optimal-transport signals for detecting hallucinations in neural machine translation and abstractive summarization.

Toward Agentic RAG for Ukrainian

Marta Sumyk, Oleksandr Kosovan

2026

Research report based on the UNLP 2026 Shared Task

Investigates two-stage retrieval with query-rephrasing and answer-retry loops for an offline Ukrainian retrieval-augmented generation pipeline.

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

Marta Sumyk, Oleksandr Kosovan

2026

HEAL @ CHI 2026

Evaluates vision-language models as autonomous auditors across macOS, Windows, and Linux benchmarks, covering accuracy, confidence calibration, and inter-model agreement.

“Are We Done Yet?”: A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents

Marta Sumyk, Oleksandr Kosovan

2026

TrustAgent @ AAAI 2026

Presents a screenshot-based evaluator for computer-use agents and a dataset of 1,260 human-labeled tasks across 42 built-in macOS applications.

2025

Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation

Viktor Muryn, Marta Sumyk, Mariya Hirna, Sofiya Garkot, Maksym Shamrai

2025

arXiv preprint

Introduces a vision-only framework that reconstructs real-time, tree-structured accessibility metadata from a screenshot.

GBEM-UA: Gender Bias Evaluation and Mitigation for Ukrainian Large Language Models

Mykhailo Buleshnyi, Maksym Buleshnyi, Marta Sumyk, Nazarii Drushchak

2025

Proceedings of the Fourth Ukrainian Natural Language Processing Workshop (UNLP 2025)

Introduces a Ukrainian-language benchmark for gender bias in hiring and evaluates prompting, embedding debiasing, and fine-tuning approaches.