timrbula/swe-bench-openhands-evaluation
move files
add oss model result
stop processing history
add log to gitignore
remove logs
add new results
remove all other benchmark outputs
explictly del df to fix oom
update gitignore
add codeact 2.1 result
remove results other than sep24
add new claude result
add new result
improve visualization
rename folder
remove mint visualizer for cleanness
add o1-mini
add gpt-4o
add llama 3.2
add 4o mini result
update gemini
fix metadata parsing
update git attribute
add gemini 1.5 pro 002
add qwen2.5 72b
rename again
rename
add llama 3.1 70b result
rename folder
add gitignore to ignore mr
add deepseek v2.5 result
add llama 3.1 405b result
remove buggy result
support only showing sep-24 eval results
rename folder
add qwen2.5
rename folder
empty
fix visualizer
add result
rename results
fix viz
add new claude results
remove coact result run on a subset
Add CoAct v1.0 trajectory (#10)
add collapsable
update instruction
remove all the with hint result
cleanup metrics and fix repo
cleanup metrics and fix repo
